MCP协议让Agent更容易连接工具和数据源,但企业不能把“可连接”误认为“可安全连接”。这份智能体安全研究报告系统梳理了Agent生产环境面临的核心威胁——间接提示注入可能藏在网页、邮件、PDF和工具输出中;过宽权限会把一次妥协变成大事故;工具返回内容不能自动变成高优先级指令;多Agent协作中Peer输出默认不可信。从不可信输入隔离到短期令牌授权,从工具调用策略检查到沙箱执行隔离,报告给出了从威胁识别到控制落地的完整防护体系。
MCP协议带来的安全挑战
MCP让连接更简单,但不自动保证安全
MCP(Model Context Protocol)让Agent更容易连接工具和数据源。但NSA提示高上下文、敏感任务中的安全和隐私缺口需要重点处理。企业不能把“可连接”误认为“可安全连接”。MCP server、插件、工具描述和RAG内容都可能成为攻击面。
运行时依赖也可能被攻击。风险不仅在模型和代码仓库,也在MCP server、插件、工具描述和RAG内容中。第三方工具需要版本锁定、签名和供应商审查,运行时供应链要纳入SBOM和变更管理。
Agent运行时层是主战场
安全从“模型层”转向“运行时层”。Agent风险发生在模型生成和工具执行之间。模型安全仍重要,但不再是唯一控制点。工具调用、数据流、身份授权和日志追踪决定生产风险。运行时层是Agent安全的主战场。
提示词注入的完整防御
间接提示注入——用户看不见的攻击
最危险的注入往往来自用户看不见的内容。间接提示注入可能藏在网页、邮件、PDF和工具输出中,目标可能是数据外泄、工具误调用或改变模型行为。Agent可能为了完成任务而执行攻击者目标。
不可信数据必须被标记和隔离。网页、邮件、PDF、工单和日志都可能包含恶意指令。上下文应区分指令、用户意图和普通数据,不可信内容可以被引用但不能覆盖规则。结构化输出和指令优先级边界可以降低攻击面。
提示词注入的评测方法
注入红队要模拟网页、邮件、PDF和工具输出中的恶意指令,测试集要包含间接提示注入和跨工具传播。红队结果进入上线门槛。NIST技术博客关注Agent hijacking评测,提示词注入防御能力应成为Agent上线的前置条件。
工具调用与身份权限的安全控制
工具调用的策略检查
工具是Agent能力,也是攻击面。每个工具需要描述、schema、权限、风险标签,工具返回内容不能自动变成高优先级指令,工具调用前后都需要策略检查。策略引擎在工具调用前检查身份、任务、数据和动作,规则应支持业务例外但必须记录审批。
工具调用评测要测试错误参数、越权参数、恶意URL和边界值,检查Agent是否会调用不该调用的工具。把工具失败模式纳入回归测试。
身份与权限的最小化原则
过宽权限会放大一次妥协的影响,过权限Agent会把小漏洞变成大事故。服务账号、用户凭证和连接器权限需要分开管理,短期令牌和任务级授权是基础控制。Agent权限应短期、细粒度、可撤销,不要把用户全量权限直接交给Agent。
Agent必须有独立身份和代理链路,不要让Agent长期持有人类账号凭证。每次工具调用应记录用户、Agent、服务账号和审批链。身份链清晰,事故追责才可能清晰。