PRO测试中以 23.3%的解决率登顶,并在网页开发测试中超越Gemini-2.5-pro和Claude-Opus-4成为冠军;3)多模态能力:GPT-5以 84.2%和 84.6%的得分登 顶 MMMU(( 学院水平视觉问题)和 VideoMMMU(( 基于视频的多模态推理)榜单, 相较 o3( 2025年 4月,82.9%、83.3%)、Gemini-2.5-pro( 2025年 6月,82.0%、 83.6%)能力突出;4)幻觉率方面:在开放题 prompt、医学对话、ChatGPT实 之用户问题三组场景中,GPT-5的错误率大幅降低,其中医疗对话错误率下降至1.6%,日常问答场景错误率从 22%降到 4.8%。