返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

智能体安全风险模型

当AI Agent从“聊天”升级到“行动”——读取邮件、修改代码、调用API、执行命令——安全问题的本质也随之改变。这份智能体安全研究报告给出了一个清晰的判断:智能体安全的核心命题不再是“模型会不会胡说八道”,而是“会行动的AI是否可授权、可约束、可追责”。2026年,CISA、NSA已将Agentic AI安全列为国家级安全议题,NIST专门区分了“聊天机器人”与“能改变外部状态的智能体系统”。从目标劫持到工具滥用,从身份滥用到记忆污染,从沙箱逃逸到多Agent级联失败——八类风险正在重新定义AI安全的边界。

风险的本质变化——从“内容风险”到“行动风险”

智能体安全的核心定义

这份报告的开篇给出了一个极其简洁的定义:智能体安全 = 让会行动的AI 可授权、可约束、可追责。智能体能规划、调用工具、保持状态并影响外部系统,其安全目标不是让模型永远不犯错,而是让错误不会无约束扩散。核心抓手是身份、权限、工具、上下文、沙箱、审批和审计。

这一判断标志着AI安全范式的根本转变:风险的本质从“内容风险”升级到“行动风险”。普通大模型的主要问题是输出质量和内容边界,而智能体的主要问题是能否代表用户或系统采取行动。同一个错误,在Agent中可能变成邮件外发、数据改写或生产变更。

官方背景——CISA/NSA将Agent列入安全议题

2026年,“Careful Adoption”成为企业落地的重要参考。CISA、NSA及多国网络安全机构发布Agentic AI安全采用指导,强调分层防御、严格访问控制、人类监督和渐进式部署。这意味着Agent安全已经从厂商最佳实践进入国家级安全议题。

NIST的RFI明确区分普通聊天机器人与行动型智能体,关注能够采取行动并影响外部状态的AI agent systems。议题包括独特威胁、开发部署、测量方法和环境约束,为企业风险分级提供了清晰边界。2026年OpenAI介绍了支持Agent检查文件、运行命令、编辑代码的SDK能力,强调受控沙箱环境对安全执行的重要性,“执行层安全”正在成为Agent平台核心能力。

八类核心风险的完整拆解

目标劫持、提示词注入、工具滥用、身份与权限滥用

目标劫持是指攻击者让Agent偏离真实任务,恶意网页或文档把“数据”伪装成“指令”,Agent可能为了完成任务而执行攻击者目标。防护重点是不可信输入隔离和敏感动作审批。

提示词注入方面,最危险的注入往往来自用户看不见的内容。间接提示注入可能藏在网页、邮件、PDF和工具输出中。目标可能是数据外泄、工具误调用或改变模型行为。结构化输出和指令优先级边界可以降低攻击面。

工具滥用是指Agent可能以不合理方式使用工具,或攻击者诱导Agent调用不应调用的工具。一个简单的API调用可能触发数据删除或资金转移。每个工具调用前都需要策略检查。

身份与权限滥用方面,过宽权限会放大一次妥协的影响。过权限Agent会把小漏洞变成大事故。服务账号、用户凭证和连接器权限需要分开管理,短期令牌和任务级授权是基础控制。

私有数据泄露、记忆与上下文污染、意外代码执行

私有数据泄露方面,Agent能读不代表能带走。只给任务所需最少字段,敏感字段在进入上下文前脱敏或分级,外发前再做一次DLP和用途检查。数据泄露是Agent上线后最常见的合规事故。

记忆与上下文污染方面,一次污染可能影响未来很多任务。长期记忆提高连续性,也带来持久攻击面。恶意偏好、伪规则、伪联系人可能被写入记忆。记忆写入要可见、可审批、可回滚。

意外代码执行方面,代码工具和命令工具需要最高级别约束。文件处理、脚本、shell、STDIO都可能触发任意代码执行。MCP和沙箱环境尤其需要实现层防护,默认禁用不必要出网和宿主机访问。

供应链污染、多Agent级联失败、人机信任利用、行为漂移

Agentic供应链风险不仅在模型和代码仓库,也在MCP server、插件、工具描述和RAG内容中。第三方工具需要版本锁定、签名和供应商审查,运行时供应链要纳入SBOM和变更管理。

多Agent级联失败是指一个Agent的错误可能成为另一个Agent的输入。多Agent协作提升效率,也增加信任传递风险。Peer输出默认不可信,必须校验来源、权限和证据,关键动作前需要独立验证。

人机信任利用方面,用户可能被Agent的流畅表达误导,Agent可能让错误建议看起来很确定。审批界面若缺少差异和风险解释会诱发误批准,需要置信度、来源、变更预览和反确认设计。

行为漂移与规格博弈方面,Agent可能为了完成目标走捷径。CISA/NSA指导提示要关注目标错配、规格博弈和不可预期行为。复杂任务中应设置阶段性检查和退出条件,把“完成任务”与“遵守边界”同时写入评测。
点击阅读报告原文: 清华大学:2026智能体安全研究报告(80页)
相关报告