返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI幻觉抑制研究

NIST已不再称其为“幻觉”,而用confabulation一词点明本质——模型自信地呈现虚假内容,是统计生成机制的固有特征。英国政府框架更明确指出,不存在永不产生虚构输出的模型。当GOV.UK品牌信任度反而放大风险,当FDA已授权超1200个AI医疗设备,幻觉治理不再是模型优化问题,而是组织制度问题。本报告基于NIST、英国政府、FDA、MHRA、NCSC等官方来源,提出从任务分级到责任治理的完整框架。

为什么“幻觉”研究必须重做

AI幻觉研究正经历一次范式转移。早期研究将幻觉视为“模型偶尔犯错”的异常现象,但NIST(美国国家标准与技术研究院)的官方定义彻底扭转了这一认知。NIST使用“confabulation”一词,指“模型自信呈现错误或虚假的内容,包括偏离提示和前后矛盾”。这一定义的关键跃迁在于:幻觉不只等于“事实错”,还包括“逻辑错”“引用错”和“上下文错”。

对组织来说,真正危险的不是模型出错,而是错误以可信口吻出现,并被用户当成了可执行的答案。当模型生成的内容被嵌入GOV.UK、医院、金融机构等权威界面时,品牌信任度会放大而非缓冲风险——用户更容易把输出当成“官方说法”。

六类幻觉类型全景

事实性幻觉——直接编造不存在的事实、数字、对象与事件,在开放问答中最常见,也相对容易被识别。

引用性幻觉——模型伪造、错配或误引法规、判例、论文、页码、链接和脚注,制造“已有证据”的错觉。这是法律、政策、学术场景中最危险的类型。

语境性幻觉——答案在一般常识上似乎没错,但对当前国家、行业或时间点并不适用。用户越觉得“像专家陈述”,越不容易意识到推理链建立在证据空白上。

逻辑性幻觉——模型在证据不足时补出一套连贯、顺滑、貌似严密的解释链条。

行动性幻觉——常见于Agent或工具调用:不仅说错,还会调用错工具、传错参数、误触发流程。

遗漏性幻觉——过度保守、漏掉关键事实、误拒答,尤其在高护栏系统中常见。

分类的目的不是学术命名,而是帮助组织对不同错误配置不同护栏。

五个根因机制

报告归纳了幻觉的五个根本机制:

统计生成机制——模型的本质是根据分布生成最可能的后续文本,而非自动连接外部真值。“能接着说下去”本身就是幻觉的结构起点。

知识边界与专业断层——通用模型更擅长平均化知识,不擅长处理实时、版本敏感、组织内部或强专业语境的问题。幻觉并非均匀分布,而是在专业边界处显著升高。

提示不充分与指令冲突——如果系统没有设计拒答逻辑,模型会倾向于继续补全,而不是承认自己不知道。

组织对速度与完整感的偏好——内部压力迫使系统在信息不足时仍给出答案。

检索-生成错配——检索到的信息未被正确用于约束生成过程。

真实世界案例验证

GOV.UK Chat的157名用户调查显示:近70%认为回答有用,65%表示满意。但官方同时观察到若干幻觉案例,并特别强调:GOV.UK品牌的可信度会让用户低估系统失真风险,形成过度信任。政府、医院、高校和金融品牌——权威界面可能是风险放大器,而非缓冲器。

GAO报告显示,联邦机构生成式AI用例从2023年的32个增长至2024年的282个,约增长9倍。组织采用加速,但治理能力并未自动同步。

FDA官员在2026年初表示已授权超过1,200个AI-enabled medical devices。MHRA的临床问答测试清楚展示了核心权衡:RAG与强护栏能压低重大幻觉,但也可能引入拒答和遗漏成本。高风险领域里,可信不是“总能回答”,而是“知道何时不该回答”。
点击阅读报告原文: 清华大学:2026年AI幻觉深度研究报告(75页)
相关报告