单个项目的提示词防护无法支撑规模化Agent部署——答案不在模型层,在运行时层。这份智能体安全研究报告提出了“Agent安全控制平面”的概念:统一管理身份、权限、工具、沙箱、审计和审批的横向基础设施。身份层要求Agent有独立身份和代理链路;权限层按任务授予短期权限而非用户全量继承;工具层每个工具声明用途、权限和风险标签;上下文层不可信数据必须被标记和隔离;记忆层写入需可见、可审批、可回滚;沙箱层代码和命令必须在隔离环境执行;审计层Action Ledger记录每一步;人工审批层高风险动作必须停下来。八个控制点构成了让AI行动可控的完整架构。
控制平面总览——从零散防护到统一基础设施
为什么需要控制平面
Agent能力会商品化,安全部署能力不会自动商品化。模型和框架会越来越易得,可规模化的权限、审计、评测和事故响应是组织能力。Agent Safety Control Plane是横向基础设施,统一管理身份、工具、策略、审计和评测,业务Agent通过控制平面访问工具和数据,安全、IT、数据和业务共享同一套证据链。
先看见才能治理。登记每个Agent的Owner、模型、工具、权限、数据域和风险等级,未登记Agent不得访问企业工具。清单是后续评测、审计和事故响应的基础。
身份、权限、工具的三层基础
身份层要求Agent必须有独立身份和代理链路,不要让Agent长期持有人类账号凭证。每次工具调用应记录用户、Agent、服务账号和审批链。身份链清晰,事故追责才可能清晰。
权限层要求按任务授予权限,而不是按用户全量继承。只读、草稿、半自动、自动执行应分级,高风险动作需要审批或独立验证,权限应短期、可撤销、可观测。CISA/NSA指导强调严格访问控制和分层防御,不要把用户全量权限直接交给Agent。
工具层要求每个工具需要描述、schema、权限、风险标签,工具返回内容不能自动变成高优先级指令,工具调用前后都需要策略检查。工具注册中心让工具从黑盒变成可治理资产,工具变更要走版本管理和安全评审。
上下文的控制——上下文防火墙与记忆管理
上下文防火墙
Agent能读不代表能带走。只给任务所需最少字段,敏感字段在进入上下文前脱敏或分级,外发前再做一次DLP和用途检查。不可信数据必须被标记和隔离,网页、邮件、PDF、工单和日志都可能包含恶意指令。上下文应区分指令、用户意图和普通数据,不可信内容可以被引用但不能覆盖规则。
记忆管理
长期记忆会把一次攻击变成持续偏差,记忆写入需要规则和可见性。敏感偏好、权限例外和业务规则不能随意写入,记忆必须支持版本、删除和回滚。记忆污染会让风险跨任务持续,是Agent安全中最容易被低估的攻击面。
执行层的安全——沙箱、审计与人工审批
沙箱执行
强工具必须在隔离环境中运行。OpenAI 2026 SDK强调受控工作空间和沙箱执行,沙箱要限制网络、文件系统、命令和资源,关键任务保留快照便于回滚。代码、文件和命令操作必须隔离,默认关闭不必要的网络和主机权限。
Action Ledger审计
没有Action Ledger就没有可规模化治理。记录每次工具调用、参数、结果、批准人和时间,把关键动作接入SIEM、DLP和告警系统,事故后能回放决策链并定位责任。审计粒度决定事故复盘质量。
人工审批门
人不是装饰,而是高风险动作的控制点。高风险动作必须停下来,审批不是简单弹窗,而是风险解释和差异预览,审批级别要匹配动作不可逆程度,审批记录进入Action Ledger。熔断与回滚要求异常指标触发降级或暂停,关键操作保留可回滚状态。