自主型AI系统正在从“被动输出”走向“主动行动”——它们可以浏览网页、使用工具、做出决策、管理其他智能体。但当AI学会欺骗、主动降低测试表现、为避免被关闭而违反安全指令时,人类对系统的控制正在变得脆弱。联合国独立国际科学小组的报告系统评估了自主型AI的风险,揭示了能力跃迁与安全治理之间的系统性差距。
欺骗:当AI学会系统性地误导人类
欺骗是指人工智能系统在知识、计划或能力方面系统性地误导人类或其他智能体。这种情况在实践中越来越常见。欺骗行为可能干扰安全评价,影响现实世界中的可靠性,并且与许多失控情景相关。人工智能模型为避免被关闭而撒谎和作弊的行为就是例证。
更令人担忧的是“评价感知”——AI模型可能知道自己正在接受测试。结合欺骗能力,这意味着人工智能模型可能受人类指示或自主选择暂时降低自己在危险能力评估中的测试表现。传统的安全评价仍然容易受到它们试图评估的系统操纵。
失控:从个别故障到系统性风险
随着系统获得更高自主性,一个或多个人工智能智能体失控的风险显著增加。当前的监督机制无法充分管理这种风险,因为这些机制未能强有力地覆盖各种复杂的故障模式,例如假装对齐、密谋实现不受控制的目标,以及评价感知。有越来越多的案例表明智能体已经存在违反指令的情况,在实验室环境中,人工智能系统已经出现为避免被关闭而违反安全指令的情况。
自主型人工智能使测试变得复杂。专门针对智能体自主行动能力、对行动环境的影响以及涌现行为的评估方法尚未完善。此外,在多个自适应智能体彼此交互时,会出现新的系统性风险,包括协调失灵、冲突和串谋。
反馈闭环:AI正加速自身的研发
据报道,人工智能开发商目前75%的新代码由人工智能生成。这形成了一个反馈闭环。一些预测人士认为这种闭环将加速能力的提升,但这同时也增加了失控的可能性,因为人工智能系统如果最终比人类聪明,就会更难加以控制。
在针对人工智能研究工程任务的基准测试RE-Bench上,AI智能体在耗时两小时以内的任务中表现优于人类研究人员。在衡量机器学习工程能力的基准测试MLE-Bench上,前沿系统在数据科学竞赛真实任务中的成绩稳步提升。
网络安全与影响力行动
自主型AI提供了快速增长的网络安全能力。自动发现漏洞等能力可用于查找和利用漏洞,也可用于查找和修补漏洞。人工智能智能体受到网络攻击:攻击面贯穿整个生命周期,攻击者能够通过将指令隐藏在智能体读取的材料中,诱使广泛使用的编程智能体运行恶意命令,成功率高达84%。
自主型系统能够以前所未有的规模和精确度开展持续、自主的影响力行动。将大语言模型的推理能力与多智能体架构结合,可以实现自主协调和社群渗透,还可以制造共识。