1.模型介绍. 舰推理模型,在事实知识、复杂推理、智能体等任务上媲美 Preview等国际顶尖模型。 2.能力优势。 (1)复杂推理。Qwen3-Max-Thinking在本次通用测评的推理任 务上取得非常优秀的成绩,具体而言,在数学推理任务中以 80.87分与Gemini-3-Pro-Preview并列全球第一,超越GPT- 5.2(high)、Claude-Opus-4.5-Rea soning等一众国际顶尖模型。在 科学推理任务中也以68.85分取得全球第六的成绩,整体的推理 能力十分强悍。 (2)智能体-任务规划。Qwen3-Max-Thinking在智能体任务上 取得70.13分,身全球Top3,超越Gemini-3-Pro-Preview,媲美 3.提升方向。 (1)幻觉控制。Qwen3-Max-Thinking在该任务上取得74.05分, 相较于Preview版本,有12分左右的提升,但整体处于中游,与 头部模型还存在14分左右的差距,存在一定的提升空间。 (2)精确指令遵循。Qwen3-Max-Thinking在该任务上取得 28.22分,位于中部水平,与海外最佳模型差距近23分,与国内 最佳模型差距超过9分。 (3)代码。Qwen3-Max-Thinking在代码生成任务上取得41.56 分,超越Gemini-3-Flash-Preview,但较最佳模型还有12分左右 的差距。