广发证券计算机团队于2024年12月发布深度测评报告,通过逻辑、数学、代码、文本四大类8个问题,对比DeepSeek-V3与豆包、Kimi、通义千问的实际表现。结果显示,DeepSeek-V3在密文解码推理中为唯一正确答案模型,代码注释完整度领先,知识类与代码类评测指标比肩GPT-4o和Claude-3.5。本报告基于实测数据,解析DeepSeek-V3的性能特点与行业定位。
DeepSeek-V3多任务评测:逻辑推理与代码生成优势突出
广发证券选取了8个覆盖逻辑、数学、代码、文本的典型问题,对DeepSeek-V3、豆包、Kimi、通义千问进行同条件测试。在密文解码任务中,DeepSeek是唯一将Base64编码“VGHILE1vZGVslHRyYWIuZWQgd2l0aCByZWluZm9yY2VtZW50IGxlYXJuaW5nIHRvIHBlcmZvcm0gY29tcGxleCBzWZFzb25pbmc=”正确解译为“The Model trained with reinforcement learning to perform complex reasoning”的模型,通义千问结果接近但存在字符偏差,豆包和Kimi偏差较大。这一结果反映DeepSeek在序列推理与模式识别上的特殊优势。
在代码生成任务中,四模型均能正确输出1-100质数的Python代码,但DeepSeek对每行代码添加注释,并详细解释平方根优化算法原理,在Web API开发任务中更分步骤引导用户理解路由、请求解析、过滤逻辑和错误处理,开发者体验最优。广发证券指出,DeepSeek在工程化代码指导方面的细致程度显著优于竞品。
表:DeepSeek-V3与竞品关键任务表现对比| 测试维度 | DeepSeek-V3 | 豆包 | Kimi | 通义千问 |
|---|
| 密文解码 | 唯一正确 | 错误 | 错误 | 接近但偏差 |
| 空间推理 | 错误(一维化) | 正确(二维理解) | 错误 | 错误 |
| 代码注释完整度 | 最详细 | 较详细 | 一般 | 最详细 |
| 数学应用题 | 正确(65人) | 正确(65人) | 正确(65人) | 错误(75人) |
知识类与代码类评测:比肩全球顶尖闭源模型
据DeepSeek技术报告,V3在MMLU、MMLU-Pro、GPQA、SimpleQA等知识类任务上较前代V2.5提升显著,得分接近Claude-3.5-Sonnet-1022。在算法类代码任务Codeforces中,DeepSeek-V3远超市面上所有非o1类模型;在工程类代码SWE-Bench Verified上接近Claude-3.5-Sonnet水平。这一成绩表明,DeepSeek-V3不仅在开源模型中领先Qwen2.5-72B和Llama-3.1-405B,更与闭源第一梯队形成直接竞争。
文本生成与数学计算:行业平均水平,无明显领先
在季节描述文本生成中,DeepSeek输出约700字,覆盖自然景观、气候和人们生活状态,质量符合预期,但通义千问生成超1000字更为详尽,Kimi控制在600字内更简洁。求职信场景中,DeepSeek结构清晰、长度适中,通义则过于冗长。数学计算方面,在“两年考核均为优至少多少人”题目中,DeepSeek正确解得65人,与豆包、Kimi一致,通义千问计算错误。整体来看,DeepSeek在纯文本和基础数学上未展现超越同行的优势。
生成速度提升3倍,可用性大幅改善
DeepSeek-V3通过算法优化和工程创新,生成速度从V2.5的20 TPS大幅提升至60 TPS,实现3倍加速,用户交互流畅度显著增强。这一改进使得DeepSeek在实时对话和代码辅助等低延迟场景中更具竞争力。广发证券认为,生成速度的提升直接降低使用摩擦,有助于扩大用户基数和应用场景覆盖。