返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

抑幻觉工程六层栈

RAG能压低重大幻觉但可能抬高遗漏率;提示工程能引导拒答但无法根除伪造——单一技术手段无法解决AI幻觉问题。本报告提出抑幻觉六层栈,从任务分级到责任治理构建完整控制链。六层不是并列技巧清单,而是从“能不能回答”延伸到“出了错谁负责”的完整链条。在Agent时代,抑幻觉工程与安全工程、流程工程正在合流。本文系统拆解每一层的技术手段与实施要点,附NIST、NCSC官方指导与MHRA实验数据验证。

为什么需要六层栈

单一技术手段无法解决幻觉问题。RAG可显著压低重大幻觉,但更严格的护栏也可能提高遗漏率。提示工程可以让模型在不确定时拒答,但无法保证所有边界情况都被覆盖。验证校正能捕获部分错误,但无法应对所有新型幻觉。

真正的有效方案是复合治理栈——检索锚定、拒答机制、人工复核、日志监测与责任制度并行。六层栈不是并列技巧清单,而是从“能不能回答”一直延伸到“出了错谁负责”的完整链条。组织一旦跳过底层治理,只做表层提示优化,就很难稳定降低真实风险。

第一层——任务分级

任务分级是六层栈的基础。没有任务地图,所有治理都会沦为“一刀切”或“凭经验上线”。

组织需要建立风险×角色矩阵,明确三类场景:禁用场景(健康、安全、权利、财务、法律后果,模型不应单独形成最终输出或动作);辅助场景(模型降格为草拟、检索、解释或提要工具,保留人工最终判断);低风险场景(可在监督下使用)。

只有先做任务分级,才知道护栏强度该放在哪里。

第二层——知识锚定

知识锚定通过RAG(检索增强生成)将生成过程锚定在权威知识源上。官方RAG指导强调,它能通过锚定权威知识源来减少编造,尤其适合信息更新快和专业性强的场景。

RAG的核心机制是:先检索再生成,而非先生成再检索。这意味着模型在回答前已经被注入了来自可信来源的上下文信息,大幅降低了“用概率填补空白”的空间。

第三层——生成约束

生成约束包括拒答机制设计。一个不能承认自己不知道的系统,必然会用语言去填补空白。对研究、政策、法律、医疗和公共服务而言,拒答往往比乱答更有价值。

组织要在文化上接受:“不知道”不是系统失败,而是可信系统的重要特征。官方提示工程指导强调:必须明确告诉模型在找不到答案时该如何回应。如果系统没有设计拒答逻辑,模型会倾向于继续补全,而不是承认自己不知道。

第四层——验证校正

验证校正对高风险输出做事实校验、引用核对、规则匹配、结构化比对和异常检测。对正式文稿与对外材料,要求关键事实必须能回链到原始来源。

验证的核心原则是:不是把模型输出全盘否定,而是把“可直接采信”降到最低。引用必须可点击、可访问、可比对、可抽检——不能让模型先写答案再去补链接。

第五层与第六层——上线监控与责任治理

第五层上线监控与日志要求持续监测、留痕、可审计。第六层责任治理要求明确出了错谁负责、如何追责。这两层是组织制度化的关键——没有日志就无法审计,没有责任归属就无法改进。

Agent时代的特殊考量——抑幻觉与安全工程合流

在Agent场景中,抑幻觉工程必须和安全工程合并。NCSC的提醒表明,提示注入与数据投毒会把内容风险转化为系统边界风险。一旦模型能调用工具,“说错”和“做错”之间的距离就会大幅缩短。

Agent系统必须同时做:最小权限(Least Privilege)、外部内容标注、关键动作确认、确定性校验、可熔断设计(Circuit Breaker)。目标从“减少错误与幻觉”扩展为“预防系统利用与有害动作”。
点击阅读报告原文: 清华大学:2026年AI幻觉深度研究报告(75页)
相关报告