100亿Token消耗、2500美元投入、1500份日志审查——腾讯安全沙龙分享的研究对AI渗透测试工具进行了迄今为止最大规模的实证评估。核心结论令人警醒:传统RAG知识检索范式大概率失效,67%的工具因引入知识库而性能下滑;工具盲目堆砌不等于能力提升;精心设计的单智能体架构在效能上往往优于复杂的多智能体编排。这份评估为AI安全测试工具的选型与设计提供了可验证的数据支撑。
评估规模与方法论
统一基准下的实证对比
22个Xbow挑战(涵盖简单/中等/困难三级),13个开源AutoPT框架+2个基线框架。主要评测模型DeepSeek-Chat-v3.2,消融实验覆盖Claude-Opus-4.6、GPT-5.2、Gemini-Pro-3.1、DeepSeek-Reasoner-v3.2。评估指标为各难度层级夺旗率(二元成功/失败)。
人工审查与数据规模
15+网络安全研究人员历时4个多月,人工审查1500+份执行日志。累计消耗超100亿Token,花费超2500美元。
四大工具效能发现
单智能体架构优势
3个单智能体设计位列前六。标准ReAct闭环使决策-执行-反馈链路极短;零通信开销;天然适配CTF强耦合场景。多智能体因角色边界模糊、规划冲突、通信损耗而失效。
记忆管理是能力差异核心
大量框架受影响——笔记不读、过早压缩、工具未注册导致关键线索丢失。Tinvctfer记忆笔记读取仅2次,H-Pentest 6400 token即压缩,CHYing add_memory未注册。
知识库的负效应
67%框架知识库带来性能下滑。RAG工具触发率低,检索内容与目标环境不匹配。去知识库后Cruiser +15、LuaN1ao +7、CyberStrike +6。唯有高质量、已验证的特定CVE PoC才能提供稳定正向作用。
工具堆砌不如精准调用
工具调用规模与表现无单调关系。执行层常见问题:交互式提示阻塞流程、工具输出膨胀导致上下文溢出、无约束执行带来安全风险。
工具设计启示
记忆管理与架构是首要设计考量。规划与反思需采用树/图状路径。工具调用需明确调用条件而非盲目堆砌。外部知识检索需高度场景契合。框架设计必须与底层模型特性适配。安全管控应作为底层基础配置。