政策制定者面临一个根本性的困境:要么在科学依据不足的情况下立即作出影响重大的AI治理决策,要么等待证据齐备,但那时再进行干预或许为时已晚。联合国独立国际科学小组的报告指出,AI能力的发展速度快于衡量或监管能力的发展速度,而全球治理能力的分布比技术能力的分布更加不均。
证据困境:为什么等不起
AI能力的发展速度快于衡量或监管能力的发展速度。企业与社会在安全验证方面存在信息不对称——前沿AI开发商构建的系统只对内部可见。安全评价方法目前主要由被评价企业设计。尽管开发商根据法律要求披露了一些信息,但政府专家获得的测试数据主要还是开发商自行选择共享的数据。
如果没有类似于制药和航空业那样严格和独立的标准化第三方评估,安全保障在很大程度上就取决于开发商的善意。与此同时,AI模型可以记住公开发布的测试答案,越来越多的测试对AI而言过于简单,模型在越来越多的测试中几乎获得满分,使这些基准测试无法区分高性能模型之间的差异。
全球AI鸿沟:谁在参与,谁被排除
人工智能鸿沟可以定义为能够获取AI的群体与无法获取AI的群体之间的差距。但AI实力不仅仅关乎获取;它有多个维度,包括基础设施实力、人才开发实力、治理和公共服务实力。
118个国家(大多为全球南方国家)没有参与主要的人工智能治理讨论,只有不到三分之一的发展中国家制定了国家人工智能战略。大多数发达经济体的政府缺乏必要的技术人员,无法理解快速的技术变革并相应地调整治理框架。各国根据现有证据应对AI风险和影响的行动能力参差不齐。
语言与文化的结构性排斥
全球使用的语言超过7000种,但当前的人工智能模型仅针对其中一小部分进行训练和优化。即使基于数十种语言构建的模型也仅在少数语言上表现良好,主流语言与代表性不足语言之间的性能差距依然存在,未见缩小。目前估计已有1000多种语言具备切实纳入AI系统所需的基础,但仍然被排除在外。
在提格雷尼亚语(700-900万人使用)中,机器翻译将“天花”译为“梅毒”,将“淋病”译为“糖尿病”,将“已为你静脉注射了抗生素”译为“已为你静脉注射了杀虫剂”。这些误译可能危及生命。
弥合差距的具体步骤
报告提出了弥合差距的具体后续步骤。专题简报将涵盖AI与环境、AI与儿童安全、AI治理工具及其有效性评价等新出现紧迫问题。小组还将考虑人工智能治理问题全球对话的成果。每项步骤都需要对会员国塑造、评估和部署AI的能力进行持续投资。小组的初步报告本身就是一种共同的证据基础,有助于会员国作出日益紧迫的决策。