【五矿证券】机械设备行业:高端制造产业跟踪(1月):DeepSeek爆火预示着投资方向的何种变化?-250207(32页).pdf
1、DeepSeek爆火预示着投资方向的何种变化?高端制造产业跟踪(1月):证券研究报告证券研究报告|行业周报行业周报2025/02/07机械设备行业机械设备行业投资评级投资评级看好看好分析师:祁岩登记编码:S0950523090001邮箱:电话:010-56307033五矿证券研究所 高端制造行业联系人:周越邮箱:联系人:张雪邮箱:板块观点01数据跟踪行情回顾新闻&公告Contents目录030204板块观点板块观点珍惜有限 创造无限DeepSeek系列为什么爆火?DeepSeek实现行业领先模型能力,并且对代码开源。在AIME2024、Codeforces、GPQA Diamond、Math-
2、500、MMLU等多个测试中,DeepSeek-R1展现出媲美OpenAI-o1的模型能力。DeepSeek的模型成本大幅下降。在成本方面,DeepSeek-R1的API服务输出定价为16元/1M Tokens,相较于openAI-o1下降96%。对2024年12月发布的DeepSeek-V3,其API服务输出订单仅为8元(活动优惠期内为2元)/1MTokens。1.板块观点4图表1:DeepSeek-R1性能比肩OpenAI o1资料来源:DeepSeek,五矿证券研究所图表2:DeepSeek-R1的价格远低于OpenAI o1资料来源:DeepSeek,五矿证券研究所4珍惜有限 创造无限
3、DeepSeek系列有哪些关键的技术突破?DeepSeek系列模型有2个核心的模型,DeepSeek V3和DeepSeek R1/R1-zero。DeepSeek V3在传统专家混合模型(MoE)上改进,实现了超低的训练成本。传统MoE模型存在负载均衡问题,在低精度训练方面也容易受到异常值影响。DeepSeek V3通过动态调整专家负载,避免了传统方案的性能损失,并且通过FP8混合精度训练框架验证了FP8在超大规模模型上的可行性。通过优化算法、框架和硬件协同,DeepSeek V3的训练需要180K H800 GPU hours(2048块H800上训练50-60天),训练成本仅557.6万
4、美元。相比之下,OpenAI训练GPT-4使用了2万块A100显卡训练90-100天,训练成本约6300万美元。DeepSeek R1/R1-zero通过大规模强化学习训练,涌现出强大推理能力。DeepSeek R1/R1-zero都是是通过大规模强化学习训练而来的模型,其中R1-zero没有将有监督微调(supervisedfine-tuning,SFT)作为初始步骤。最早采用强化学习方法进行训练的模型是OpenAI o1。OpenAI研究科学家、o1核心贡献者Hyung Won Chung 在MIT进行过一次名为“Dont teach.Incentivize(不要教,要激励)”的演讲,就论
5、述了这一理念。Hyung WonChung 认为AI领域正处于一次范式转变,即从传统的直接教授技能转向激励模型自我学习和发展通用技能。AGI所需要的技能太多,我们无法列举出每一项技能去teach,因此唯一可行的方法就是incentivize激励,让模型自己的思考、去涌现新的能力。在训练中,R1/R1-zero的推理能力通过强化学习自然涌现,思考时间随着模型的进行持续提升,自然而然地获得了解决越来越复杂推理任务的能力。相比R1,R1-zero省略了监督有监督微调SFT环节,完全依赖于强化学习,进一步减少了人工干预,引起了更多的关注。这对于那些难以获取大量高质量标注数据的领域来说,具有重要的意义。
6、1.板块观点5珍惜有限 创造无限DeepSeek系列的影响?开源VS闭源大模型领域一直存在开源和闭源的争议。OpenAI的GPT系列是闭源模型的代表,而开源模型阵营则有meta的Llama模型。在国内,华为、百度选了闭源,而阿里、腾讯则推出了开源模型。不论开源、闭源,在透明性、合规性、安全性方面都有很多分歧与争议。DeepSeek作为一个开源模型,其爆火意味着开源模型领域的一次大的突破。从商业模型角度,也意味着模型门槛的大幅降低,有更多的企业、技术人员可以进入大模型领域,并开发针对自己特定领域的模型。这对AI领域的加速发展无疑是一种利好。预训练VS后训练前OpenAI联合创始人、SSI创始人I





点击查看更多