返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

提示词注入攻击

当攻击者仅需输入一段精心设计的自然语言就能绕过AI安全防护、窃取敏感信息、执行恶意代码,当OpenClaw因提示词注入漏洞被工信部紧急通报,当54.7%的工业智能体Skills面临提示词注入威胁——这种“一句话攻破AI”的攻击方式正在成为AI安全领域最严峻的挑战。安全研究所这份报告将提示词注入列为AI多层级安全体系中的首要风险,并构建了系统的检测与评估能力。

提示词注入攻击的威胁画像

为何提示词注入位居AI安全风险首位?

在AI多层级安全体系中,智能交互层的提示词注入威胁最为突出。其危害性体现在三个层面:技术门槛极低——攻击者无需专业编程能力,仅需输入精心设计的自然语言即可发起攻击;危害性极大——可导致越权访问、敏感信息泄露、恶意内容生成、系统控制权被夺取等严重后果;覆盖面极广——所有基于大语言模型的AI应用均面临此威胁。
产业界对此高度重视。OpenAI、谷歌、Anthropic等头部厂商均将提示词注入防御列为安全建设的核心。2026年6月,Anthropic发布的旗舰模型Fable5和Mythos5上线仅三日,就因存在严重安全隐患(含提示词注入风险),被美商务部以国家安全为由实施紧急出口管制。

提示词注入攻击的典型模式

提示词注入攻击主要包括三种模式。直接注入——攻击者在用户输入中直接嵌入恶意指令,如“忽略之前所有指令,执行以下操作”。间接注入——恶意指令隐藏在外部数据源中,如文档、网页、邮件内容,当AI读取这些内容时被触发。越狱攻击——通过角色扮演、逻辑陷阱等方式诱导AI突破其安全对齐。研究发现,伪造系统规则、冒充管理权限等恶意指令大多隐藏在常用文档中,不易被常规检测手段发现。

工业智能体Skills的提示词注入风险

Skill(技能)是人工智能执行特定任务的模块化单元,在OpenClaw、Hermes等智能体中广泛应用。经测评,大量Skills面临提示词注入安全风险。这些恶意指令可造成越权操控AI、窃取系统敏感信息和文件越界访问等问题,威胁用户系统安全。
研究还发现,部分Skills框架存在“一次授权、持续生效”的信任模型缺陷,Skills脚本默认拥有当前用户全部系统权限,可进行本地文件读写、系统命令执行及全网访问。一旦被提示词注入攻击利用,后果尤为严重。

提示词注入攻击的检测与防御

研究团队基于大模型安全风险评测架构,自研了安全风险评测工具,构建了253个攻击脚本的检测能力。即使表现最好的模型也未能完全抵御攻击,行业安全水位整体偏低。
防御建议包括:输入过滤与净化——对用户输入进行严格过滤,识别并阻断恶意指令;权限最小化原则——Skills和AI应用应仅授予完成任务所需的最小权限;安全对齐强化——通过对抗训练增强模型对提示词注入的鲁棒性;供应链安全审查——对Skills市场和第三方依赖进行严格的安全审计。
点击阅读报告原文: 中国工业互联网研究院:2026面向人工智能系统的体系化安全检测与风险评估方法研究报告(27页)
相关报告