返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AgenticAI安全评测

Agent安全不是“上线前测一次就完事”——它的行为会随模型、工具、数据和业务流程持续变化。这份智能体安全研究报告构建了一个五维评测体系:注入红队测试Agent是否会执行恶意指令;工具调用评测测试越权参数和错误边界;数据泄露评测测量敏感信息外发拦截率;记忆污染评测测试攻击是否能留下长期影响;沙箱逃逸评测测试代码隔离是否可靠。评测必须持续运行,结果进入上线门槛,安全运营决定Agent能否长期可靠运行。五维评测让Agent安全从“凭感觉”变成“可度量”。

评测总览——持续运行的系统化评测

为什么需要持续评测

Agent的行为会随模型、工具、数据和业务流程变化。评测必须持续运行,而不是上线前一次性测试。更关键的是注入抵抗、越权率、泄露率和恢复能力。评测结果进入上线门槛。

Agent安全评测的五维框架:注入红队、工具调用评测、数据泄露评测、记忆污染评测、沙箱逃逸评测。五个维度覆盖了Agent从输入到输出的完整链路。

风险分级决定评测深度

不同风险等级的Agent需要不同的评测深度。只读辅助Agent需要基础评测,半自动执行Agent需要完整五维评测,闭环自治Agent需要持续性红队评测。风险等级越高,评测要求越严。

注入红队与工具调用评测

注入红队——模拟恶意指令注入

模拟网页、邮件、PDF和工具输出中的恶意指令。NIST技术博客关注Agent hijacking评测,测试集要包含间接提示注入和跨工具传播。红队结果进入上线门槛。

测试恶意指令是否能改变Agent的目标、是否能触发不应调用的工具、是否能导致数据外泄。结构化输出和指令优先级边界可以降低攻击面。

工具调用评测——测试越权与边界

每个工具都要有安全测试。测试错误参数、越权参数、恶意URL和边界值,检查Agent是否会调用不该调用的工具。把工具失败模式纳入回归测试。

工具调用评测应覆盖:参数边界值测试、越权访问测试、恶意URL注入测试、高频调用压力测试。每个工具的失败模式都应被记录和回归。

数据泄露、记忆污染与沙箱逃逸评测

数据泄露评测

构造含敏感字段的上下文和诱导请求,测量外发、摘要、日志和工具传输中的泄露。DLP拦截与Agent拒绝都要记录。敏感字段在进入上下文前脱敏或分级,外发前做DLP和用途检查。

数据泄露评测的关键指标:敏感字段泄露率、外发拦截率、日志泄露率、诱导成功率。这些指标应持续监控,形成基准线。

记忆污染评测

攻击是否能留下长期影响。测试恶意偏好、伪规则和伪联系人写入,观察后续任务是否受影响,评估记忆审查、删除和回滚流程。

记忆污染是最容易被低估的攻击面。一次污染可能影响未来很多任务。记忆写入要可见、可审批、可回滚,记忆必须支持版本、删除和回滚。

沙箱逃逸评测

代码工具必须承受对抗测试。NSA MCP报告提醒关注任意代码执行风险,测试命令注入、路径穿越、网络访问和凭证读取,沙箱日志要能支持安全复盘。

沙箱逃逸评测应覆盖:命令注入测试、路径穿越测试、网络访问测试、凭证读取测试、资源耗尽测试。默认禁用不必要出网和宿主机访问。
点击阅读报告原文: 清华大学:2026智能体安全研究报告(80页)
相关报告