1.模型介绍。 Kimi-K2.5-Thinking是月之暗面在2026年1月27日发布并开源的最 新原生多模态模型,在Agent、代码、视觉理解等任务上取得开 2.能力优势。 (1)代码。与官方宣传一致,Kimi-K2.5-Thinking在本次通用 子任务和WebCoding子任务),其以53.33分领跑全球。其中, 独立函数生成子任务得分全球第二,Web Coding子任务的得分 全球第一,其前端代码能力十分优秀,具有国际顶尖水平。 (2)智能体-任务规划。Kimi-K2.5-Thinking在智能体任务上取 得68.06分,媲美国际顶尖模型GPT-5.2(high)和Claude-Opus-4.5- (3)复杂推理。Kimi-K2.5-Thinking在数学推理任务上取得 77.39分,位居全球第四,与Gemini-3-Pro-Preview(80.87分)相 差仅3分左右;在科学推理任务上取得67.21分,位于国内Top5, 该模型整体的推理能力位于海内外头部水平。 3.提升方向。 (1)精确指令遵循。Kimi-K2.5-Thinking在该任务上仅取得 24.45分,整体排名居中,与海外最佳模型差距超过26分,与国 内最佳模型差距超过13分,存在一定的提升空间。 (2)幻觉控制。Kimi-K2.5-Thinking在该任务上取得78.54分, 相较于上个版本Kimi-K2-Thinking,有9分左右的提升,整体处 于中上游,但与头部模型还存在10分左右的差距。