返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

OpenAI o1推理模型

大语言模型在逻辑推理方面的能力边界正在被OpenAI o1重新定义。中信建投研报显示,在国际数学奥林匹克(IMO)资格考试中,GPT-4o仅能正确解答13%的问题,而o1模型正确率高达83%。在Codeforces编程竞赛中,o1排名达到前89%,推理能力实现跨越式提升。o1通过强化学习训练,在复杂问题上花费更多时间进行深度思考,而非直接回应,实现了思维策略的自我完善。

从GPT-4o到o1:推理能力的跨越式提升

OpenAI o1是经过强化学习训练来执行复杂推理任务的新型语言模型,在响应用户之前可以产生很长的内部思维链,像人类一样花更多时间思考问题。OpenAI在物理、化学和生物学等挑战性基准任务上的测试表明,o1系列模型的表现与博士生水平相当。

在IMO资格考试中,GPT-4o正确解答率仅13%,o1达到83%,提升幅度约6.4倍。在Codeforces编程竞赛中,o1排名前89%。在54/57个MMLU子类别上,o1表现均优于GPT-4o。这种全方位的推理能力提升,标志着大语言模型从“能说会道”向“逻辑思考”的关键转变。

思维链+思维树:o1的推理架构基础

思维链(CoT)通过中间推理步骤帮助大模型实现复杂推理能力。思维树(ToT)进一步引导语言模型探索思维作为中间步骤,由连贯的语言序列表示解决问题的中间步骤。大语言模型能够对严谨推理过程的中间思维进行评估,将生成及评估能力与广度优先搜索、深度优先搜索算法相结合。

o1深度融合思维树和强化学习,实现思维树的自我训练,通过广度搜索和深度搜索不断优化思维树结构,进而实现思维模式的深度探索。这种架构使o1能够“像AlphaGo下棋一样思考”——在推理过程中探索多条思维路径,选择最优方案。

o1-ioi在IOI竞赛中的金牌表现

基于o1初始化并进一步训练编程技能后,o1-ioi模型在2024年国际信息学奥林匹克竞赛(IOI)赛题上获得213分,达到前49%的水平,参赛条件与人类选手一致——在10小时内解答6道高难度算法题,每题仅限提交50次答案。

当每题允许提交10000次时,模型获得362.14分,高于金牌门槛,无需测试时间选择策略即可达到金牌水平。这说明o1的推理能力已具备与人类顶尖选手竞争的潜力,随着推理时间增加,模型性能持续提升的规律也为未来进一步突破奠定了基础。

强化学习驱动的推理能力进化

o1通过强化学习训练学会完善自己的思维过程,尝试不同的策略,并认识到自己的错误。与AlphaGo Zero类似——o1的指导老师不是人类标注数据,而是基于蒙特卡洛树搜索(MCTS)的自我博弈生成训练数据。模型在与环境的反复交互过程中持续学习,不断最大化其奖励。

OpenAI构建了PRM800K数据集(75,000个问题中的800,000个解决步骤标签),采用过程监督奖励模型接收思路链中每一步的反馈,提供更精确的反馈并精确定位错误位置。相比仅使用最终结果训练的结果监督模型,过程监督使o1能够遵循人类认可的思路链,避免“用错误推理得出正确答案”的问题。
表:OpenAI o1与GPT-4o推理能力对比
测试项目GPT-4oOpenAI o1
IMO数学竞赛正确率13%83%
Codeforces编程竞赛排名前89%
IOI信息学竞赛得分(50次提交)213分(前49%)
IOI竞赛(万次提交)362.14分(金牌)
MMLU子类别优势54/57优于GPT-4o
点击阅读报告原文: 电子行业OpenAI o1:逻辑能力显著提升推理侧算力消耗大幅增加-240919(23页)
相关报告