返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI推理能力提升

AI推理能力的提升正在加速。财通证券报告显示,DeepSeek-R1在数学推理、编程竞赛、科学问答等多个维度实现了对主流模型的全面超越——AIME 2024 79.8%、MATH-500 97.3%、Codeforces 2029 Elo、GPQA Diamond 71.5%。R1-Zero通过纯强化学习从15.6%自主提升至71.0%。R1-Distill系列让小模型达到o1-mini水平。从大模型到小模型,从数学到编程,AI推理能力正以前所未有的速度进化。

数学推理——AIME 79.8%与MATH-500 97.3%的新高度

DeepSeek-R1在数学推理任务上展现出了顶尖水平。在AIME 2024基准测试中,R1取得79.8%的pass@1成绩,略高于OpenAI-o1-1217的79.2%,并远超DeepSeek-V3的39.2%和GPT-4o的9.3%。

在MATH-500上,R1取得了97.3%的惊人成绩,与o1-1217的96.4%相当,远高于Claude-3.5-Sonnet-1022的78.3%、GPT-4o的74.6%和DeepSeek-V3的90.2%。这意味着在500道具有挑战性的数学问题中,R1几乎全部正确回答。

更值得关注的是R1-Zero的表现——在没有经过任何监督微调的情况下,纯强化学习训练的模型在AIME 2024上达到71.0%,在MATH-500上达到95.9%。这证明AI的数学推理能力可以通过自主学习获得,而不完全依赖于人类的知识灌输。

编程能力——Codeforces 2029 Elo,超越96.3%人类程序员

DeepSeek-R1在编程竞赛任务中展现了专家级水平。在Codeforces平台上,R1获得2029 Elo评级,表现优于96.3%的人类参与者,与OpenAI-o1-1217的2061评分处于同一梯队。

在LiveCodeBench代码竞赛基准测试中,R1以65.9%的pass@1成绩超越了所有对比模型——Claude-3.5-Sonnet-1022为38.9%,GPT-4o为32.9%,DeepSeek-V3为36.2%,OpenAI-o1-1217为63.4%。R1在Aider-Polyglot多语言编码任务中以53.3%的准确率超越了o1-1217的52.9%。

编程能力的提升具有重要的产业意义。代码生成和编程辅助是大模型最具商业化潜力的应用场景之一,R1在编程任务上的优异表现意味着它可以为软件开发者提供更高质量的辅助,提升开发效率。Codeforces 2029 Elo的评级证明,R1已经具备了与人类高水平程序员竞争的能力。

科学推理——GPQA Diamond 71.5%与多语言能力

在科学推理领域,DeepSeek-R1同样表现突出。在GPQA Diamond(研究生级别科学问答)基准测试中,R1取得71.5%的成绩,超越了Claude-3.5-Sonnet-1022(65.0%)、GPT-4o(49.9%)和DeepSeek-V3(59.1%)。

在FRAMES长文档推理任务中,R1以82.5%的准确率超越了GPT-4o(80.5%)和DeepSeek-V3(73.3%)。在DROP(3-shot F1)阅读理解与推理测试中,R1得分为92.2,超越了Claude-3.5的88.3和DeepSeek-V3的91.6。

中文能力方面,R1在C-Eval中文综合评测中达91.8%,超越DeepSeek-V3的86.5%和GPT-4o的76.0%;在C-SimpleQA中文问答中达63.7%,超越GPT-4o的40.3%。这体现了R1在多语言推理任务上的良好表现。

从大模型到小模型——推理能力的普惠化

DeepSeek团队不仅展示了R1在大模型上的推理能力突破,更重要的是通过知识蒸馏技术将这种能力传递给了小模型,实现了推理能力的普惠化。

R1-Distill-Qwen-32B在AIME 2024上达到72.6%,与o1-mini的63.6%相比优势明显;在MATH-500上达94.3%,远超o1-mini的90.0%;在Codeforces上达1691评分,接近o1-mini的1820。一个32B参数的模型能够达到接近o1-mini的推理水平,这在此前是不可想象的。

更小规模的模型同样表现优异。Qwen-7B蒸馏模型在AIME 2024上达55.5%,MATH-500达92.8%,已经超过了GPT-4o的数学推理能力。Llama-8B蒸馏模型在AIME 2024上达50.4%,Codeforces评分1205。

推理能力的普惠化意味着,未来不需要依赖最昂贵的云端大模型API,中等规模甚至小规模的模型就可以在边缘设备上实现高质量的推理能力。这对于AI技术在成本敏感场景和隐私敏感场景中的普及具有深远意义。
点击阅读报告原文: 财通证券:计算机行业专题报告DeepSeek-R1强化学习知识蒸馏比肩o1(13页)
相关报告