返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

o3-mini性能对比

DeepSeek的崛起引发了OpenAI的强力反击。信达证券研报指出,OpenAI发布了o3-mini——在物理推理能力方面超越DeepSeek R1,能生成四维空间物理模拟程序。编程能力方面,用户仅需一个提示,o3-mini仅用8秒时间就可克隆一个应用。此外,OpenAI还发布了DeepResearch,在“人类终极考试”中得分26.6%,远超GPT-4o的3.3%和o1的9.1%。AI推理能力的竞争正在从“语言”走向“物理世界理解”。

o3-mini物理推理——超越R1的关键能力

在物理模拟高难度挑战中,o3-mini展现惊人实力。在模拟小球转动时,o3-mini具备更强的物理推理能力,而DeepSeek R1出现了反重力现象,反映出对物理规律理解的偏差。o3-mini能生成四维空间内小球的弹射程序,展现出很高潜力。

物理推理能力是AI从“语言模型”走向“世界模型”的关键能力。理解物理世界意味着AI可以更准确地预测现实世界的物体运动、交互和变化,这对自动驾驶、机器人控制、科学模拟等应用至关重要。o3-mini在这一领域的优势,反映了OpenAI在“理解物理世界”方向上的持续投入。

编程能力——8秒克隆应用的效率革命

编程能力方面,o3-mini表现惊人。用户仅需一个提示,o3-mini就能在8秒内用单个Python文件写一个Twitter克隆应用。此外,o3-mini还可以用单个提示生成贪吃蛇、射击等游戏。用户要求o3-mini构建一个“漂浮城市”,它也能快速生成。

编程能力的飞跃意味着AI可以大幅降低软件开发门槛。从克隆应用到游戏开发,o3-mini展示了AI在代码生成方面的全能性。这对软件开发行业的效率提升和人力结构变化具有深远影响。

DeepResearch——研究分析师级别的AI代理

DeepResearch是OpenAI新发布的代理——仅需一个提示,ChatGPT可查找、分析和综合数百个在线资源,创建研究分析师级别的综合报告。由针对Web浏览和数据分析优化的o3模型版本支持,利用推理搜索、解释和分析互联网上的大量文本、图像和PDF。

在“人类终极考试”中,DeepResearch得分26.6%,远超GPT-4o的3.3%、o1的9.1%、o3-mini的13.0%。专家级别任务通过率同样显著领先。DeepResearch的发布标志着AI从“问答工具”向“研究助理”的跃迁,知识工作领域正面临AI的深度渗透。

定价策略——OpenAI的低价反击

o3-mini定价策略明显针对DeepSeek。每百万tokens输入价格0.55美元(缓存命中)/1.1美元(缓存未命中),输出价格4.4美元。相较DeepSeek R1的0.14/0.55/2.19美元仍偏贵,但显著低于o1的7.5/15/60美元。OpenAI通过低价策略应对DeepSeek的性价比优势。

AI推理成本的持续下降推动AI应用普及。DeepSeek和OpenAI的价格竞争正在使AI推理从“奢侈品”变成“日用品”,加速AI在各行各业的渗透。
表:DeepSeek R1与o3-mini性能定价对比
指标DeepSeek R1o3-mini优势
物理推理出现反重力现象理解四维物理o3-mini
编程速度8秒克隆应用o3-mini
输入定价$0.55$1.10DeepSeek
输出定价$2.19$4.40DeepSeek
点击阅读报告原文: 【信达证券】电子行业专题研究(普通):Deepseek R1是AGI的里程碑,中长期利好算力硬件-250204(17页)
相关报告