介绍:主要考察模型的指令遵循能力,包括但不限于定义的输出格式或标准来生成响应,精确地呈现要求的数据和信息。涉及的中文场景包括但不限于结构约束、量 化约束、语义约束、复合约束等不少于4个场景。 评价方式:基于规则脚本的0/1评估。 1.梯度分化明显,海外头部领 先显著。 前四名均为海外模型且分差较大, Claude-Opus-4.5-Rea soning 以51.10 分位居榜首,与第二名拉开了近8 分的差距。国产模型ERNIE-5.0、 等紧随其后,与第一名差距超过13 分。国内模型在该任务上的平均分 为19.97分,海外模型的平均分为 27.02分,相差近7分,还有一定的 提升空间。 化严重。 级,难度从等级2到等级9(等级2 整体题目难度较大,所有模型在该 任务上的整体平均分仅22.72分,超