国信证券OpenAI 12天发布会专题报告指出,Day12发布的o3系列模型实现了AI推理能力的里程碑式突破。o3在ARC-AGI基准测试中达到87.5%的准确率,远超人类85%的阈值,成为AI领域第一次超越人类成绩的模型。在编程(SWE-bench 71.7%)、数学(AIME 2024近满分)、科学(GPQA 87.7%)领域均实现跨越式提升。o3 mini支持低中高三种自适应推理时间,预计2025年1月底开放。本报告解析o3模型的技术突破与性能表现。
ARC-AGI基准87.5%超越人类,AI通用推理能力里程碑突破
o3在ARC-AGI(抽象与推理语料库)基准测试中达到了87.5%的准确率,远超人类85%的阈值。ARC-AGI基准测试旨在评估AI系统的抽象和推理能力,要求AI识别模式并解决从未见过的新问题,是衡量通用人工智能(AGI)进展的关键指标。o3成为AI领域第一次超越人类成绩的模型,标志着AI在通用推理能力方面迈出了重要一步,接近AGI的标准。
o3的突破性在于其推理能力的泛化性——不仅能处理训练数据中的问题,更能通过推理解决全新场景中的复杂任务。ARC-AGI的创建者François Chollet表示,o3的表现标志着AI在推理能力上的一次“阶跃变化”,为复杂决策和高端问题解决提供了新的技术基础。
表:o3 vs o1核心性能对比| 基准测试 | o1表现 | o3表现 | 提升幅度 |
|---|
| ARC-AGI(通用推理) | 约25-30% | 87.5% | 超人类85%阈值 |
| SWE-bench Verified(编程) | 约48.9% | 71.7% | +22.8pct |
| AIME 2024(数学) | 约80% | 近满分(>95%) | 历史最高 |
| GPQA Diamond(科学) | 约78% | 87.7% | +9.7pct |
编程能力超越大多数软件工程师,SWE-bench达71.7%
o3在编程领域的提升尤为显著。在SWE-bench Verified基准测试中,o3的准确率达到71.7%,比o1高出20个百分点以上。SWE-bench Verified评估模型解决真实世界GitHub问题的能力,包括理解代码库、定位bug、编写和测试修复代码等复杂任务。71.7%的得分意味着o3在编写高质量代码方面已经超过了大多数软件工程师。
o3 mini作为o3系列的高效推理模型,支持低、中、高三种不同的推理时间选项,用户可根据使用情况自由调整模型的推理时间。在低推理时间下,o3 mini的代码性能已优于o1 mini,在速度和成本方面表现出色,适用于任何需要数学和编码能力的场景。
数学与科学领域历史最佳,AIME 2024近满分
在数学领域,o3在AIME 2024(美国数学邀请赛)中几乎获得了满分,这是AI在该竞赛中取得的最好成绩。AIME是一项极具挑战性的高中数学竞赛,o3的表现证明其在处理复杂数学问题时已达到顶尖水平。在GPQA Diamond博士级科学考试中,o3的准确率达到87.7%,比o1高出近10个百分点。GPQA Diamond涵盖生物学、物理学、化学等多个博士级别科学问题,o3的优异表现反映了其在跨学科科学推理方面的深度能力。
o3 mini在AIME 2024测试中同样表现出色,低推理选项与o1 mini性能相当,中位数推理时间性能更好,高推理可进一步提升。延迟大幅减少,支持函数调用等功能,性能优于多数模型。
协商对齐保障安全性,2025年1月底开放o3 mini
OpenAI为o3引入了协商对齐(deliberative alignment)的安全评估方法。该方法让模型在回答问题前明确回忆安全规范并准确执行推理,确保o3的行为符合OpenAI的安全政策。目前o3处于早期访问阶段,仅对部分安全研究人员开放。OpenAI计划在2024年1月底推出o3-mini,届时更多开发者和用户将能体验o3系列的强大推理能力。o3系列标志着AI从“回答已知问题”向“推理未知问题”的范式转变,为AI在各行业深度应用奠定了技术基础。