介绍:主要考察模型在执行中文生成任务时应对忠实性幻觉的能力。包括但不限于文本摘要、阅读理解、多文本问答和对话补全等基础语义理解与生成创作数据集。 评价方式:基于人工校验参考答案的、对每个句子是否存在幻觉进行0/1评估。 海外头部模型占据显著优势, 国内头部模型已有突破。 GPT-5.2(high)(88.56分)和Claude- Opus-4.5-Reasoning(88.31分)以 17分以上的优势领先平均水平,展 上的统治力。值得关注的是, GLM-4.7以83.85分路身榜单Top3, 内;此外,Doubao-Seed-1.8- 尖模型Gemini-3-Flash-Preview。