AI推理能力的突破正在加速。信达证券研报指出,DeepSeek-R1在推理任务上实现与OpenAI-o1-1217相当的性能。面对DeepSeek的挑战,OpenAI发布了o3-mini——仅8秒时间就可克隆一个应用、物理推理能力突出、能生成四维空间物理模拟。此外,OpenAI还发布了DeepResearch,在“人类终极考试”中得分26.6%,远超GPT-4o的3.3%和o1的9.1%。AI推理能力的提升正推动AGI商业化奇点临近。
DeepSeek-R1——推理能力比肩OpenAI o1
DeepSeek-R1在推理任务上实现与OpenAI-o1-1217相当的性能。在AIME 2024、MATH-500、GPQA Diamond等多项基准测试中,DeepSeek-R1表现接近或超越o1模型。蒸馏小模型DeepSeek-R1-Distill-Qwen-32B在AIME 2024得分72.6%、MATH-500达94.3%、LiveCodeBench达57.2%,可与o1-mini相媲美。
DeepSeek证明较大模型的推理模式可以提炼成较小的模型,性能更好。开源检查点覆盖1.5B到70B六个规模,使研究社区能够在不同资源约束下部署高性能推理模型。
o3-mini——物理推理与编程能力的飞跃
为了应对DeepSeek的挑战,OpenAI发布了o3-mini。在物理模拟高难度挑战中,o3-mini展现惊人实力。在模拟小球转动时,o3-mini具备更强的物理推理能力,而DeepSeek R1出现了反重力现象。o3-mini能生成四维空间内小球的弹射程序,展现很高潜力。
编程能力方面,用户仅需一个提示,o3-mini就能在8秒内用单个Python文件写一个Twitter克隆应用。此外,o3-mini还可以用单个提示生成贪吃蛇、射击等游戏,编程能力让人惊叹。o3-mini理解物理世界的能力突出,是AI从“语言模型”走向“世界模型”的关键一步。
DeepResearch——研究分析级别AI代理
DeepResearch是OpenAI新发布的代理——仅需一个提示,ChatGPT可查找、分析和综合数百个在线资源,创建研究分析师级别的综合报告。由针对Web浏览和数据分析优化的o3模型版本支持,利用推理搜索、解释和分析互联网上的大量文本、图像和PDF。
在“人类终极考试”中,DeepResearch得分26.6%,远超GPT-4o的3.3%、o1的9.1%、o3-mini的13.0%。专家级别任务通过率同样显著领先。DeepResearch的发布标志着AI从“问答工具”向“研究助理”的跃迁。
推理能力突破的产业意义
推理能力的持续突破正推动AI从“简单问答”走向“深度推理”。DeepSeek与OpenAI的竞争表明推理能力是当前大模型竞争的核心战场。o3-mini在物理世界理解方面的突破,为AI在自动驾驶、机器人等物理世界交互场景的应用奠定了基础。
DeepResearch则展示了AI在知识工作领域的巨大潜力——研究分析、报告撰写、信息综合等知识密集型工作正面临AI的深度渗透。扎克伯格预测,未来每个企业都将拥有客户可交互的AI代理,这一时点正在逐步临近。
表:主要推理模型性能与定价对比| 模型 | AIME 2024 | 输入定价(百万tokens) | 输出定价(百万tokens) |
|---|
| DeepSeek-R1 | 79.8% | $0.55(缓存未命中) | $2.19 |
| OpenAI o3-mini | — | $1.10(缓存未命中) | $4.40 |
| OpenAI o1 | — | $15.00(缓存未命中) | $60.00 |
| GPT-4o | 13.4% | $2.50(缓存未命中) | $10.00 |