返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

大模型数据集构建流程

数据决定模型质量的上限——这是大模型训练的第一性原理。华为云《盘古大模型最佳实践》系统拆解了NLP大模型数据集的完整构建流程:增量预训练数据从源数据获取到发布的六个步骤,微调数据从问答对构建到配比优化的完整链路。本文结合金融场景下的具体案例,详解了数据加工算子、配比策略和评估方法。

增量预训练数据集——六步构建法

获取源数据与预处理

常用数据来源包括网页、对话、书籍、代码、学术论文及开源数据集。推荐数据集:FineWeb Edu(1.3万亿token教育类数据)、OpenNewsArchive(880万篇中文新闻)、CCI3.0-HQ(500GB高质量中文文本)、IndustryCorpus2(31个行业类别,1TB中文+2.2TB英文数据)、CCI3.0(1000GB语料库)。

数据预处理要求将文本处理为JSONL格式,每行一个JSON字符串,只包含“text”字段。样例如下:{"text": "近日,全省对涉煤收费进行清理规范..."}

导入、加工与评估

导入平台需完成OBS桶、资源池等准备工作,单个文件不超过50GB。加工算子包括符号标准化、异常字符过滤、个人数据脱敏、敏感词过滤、问答对去重。可通过自定义算子针对特定业务场景进行灵活加工。评估通过抽样评估方式检查数据质量和代表性,涵盖完整性、准确性、一致性、领域覆盖、分布合理性、多样性等维度。

配比并发布数据集

不同数据源与模型特定能力学习紧密相关。通用文本数据保留模型通用能力,行业文本数据提升下游任务能力。行业数据和通用数据比例建议在1:4至1:9之间——行业数据比例过高可能丢失通用能力,过低则无法学习行业知识。配比后在平台发布为“标准格式”或“盘古格式”。

微调数据集——问答数据构建

获取源数据与预处理

微调数据集为问答数据,分为通用数据集和行业数据集。推荐通用数据集:中文Smoltalk(70万+记录)、OpenThoughts3-1.2M(85万数学+25万代码+10万科学问题)。推荐行业数据集:Fino1_Reasoning_Path_FinQA(金融推理)、OpenFinData(东方财富与上海AI实验室联合发布)。数据格式为JSONL,每行包含context(问题)和target(回答),system字段支持自定义人设。单轮问答context为string,多轮问答context为数组。带思维链的逻辑推理数据示例包含标签标注的思考过程。

加工、配比与发布

加工算子包括中文简繁互转、个人数据脱敏、问答对去重等。行业指令数据和通用指令数据比例建议控制在1:3左右——医疗场景优先医学领域数据,金融场景关注财经新闻和金融报告,法律场景注重法律条文和判例库,客服场景重点考虑用户交互数据。配比后在平台发布为“盘古格式”或“盘古格式-思维链”。

金融场景数据配比案例

增量预训练配比方案

金融场景增量预训练使用IndustryCorpus2中40GB中文金融+40GB英文金融数据,按1:6比例配比480GB通用预训练数据(英文FineWeb Edu和中文CCI3.0-HQ各一半),总计560GB训练数据。

微调配比方案

金融催收意图识别微调使用31万条通用中文指令数据(Smoltalk)和8万条金融中文指令数据(Fino1+OpenFinData),配比比例约1:4。模型蒸馏场景中,500条场景数据配比1500条通用指令+1500条金融指令数据,按1:1:1配比。
点击阅读报告原文: 华为云:2026盘古大模型最佳实践报告(186页)
相关报告