国金证券报告指出,工业AI发展的核心前提之一是解决非结构化数据处理难题。工业领域涵盖41个大类、207个中类、666个小类,数据来源多样、质量参差不齐。多模态大模型“any2any”技术演进趋势有望降低工业场景非结构化数据的处理难度。目前工业大模型主要分为三种构建模式:基于大量工业数据打造预训练工业大模型(如SymphonyAI基于3万亿数据点、12亿token训练);在基础大模型上通过工业数据微调(如Cohere微调套件);通过检索增强生成RAG外挂行业知识库(如Cognite利用RAG整合多源数据)。增强RAG技术能够与工业非结构化数据建立对话、理解检索意图、通过外挂知识库提升结果可靠性、降低幻觉,有望大幅降低工业数据清洗和预处理成本。
预训练工业大模型——SymphonyAI的3万亿数据点实践
预训练工业大模型基于大量工业数据和通用数据打造,支持各类应用开发。硅谷创业公司SymphonyAI推出基于无监督预训练的工业大语言模型,训练数据包含3万亿个数据点、12亿token,能够支持机器状况诊断,并回答故障状况、测试程序、维护程序、制造工艺和工业标准相关的问题。预训练模型优势在于具备部分工业领域的通用理解能力,可作为基础模型支持多种工业应用开发,但成本较高、缺乏对特定任务的优化能力。适用于作为基础平台支撑多种工业应用,企业可在其基础上开发定制化功能。
微调——Cohere微调套件精准适配特定任务
微调是指在已经预训练好的模型基础上,使用特定数据集进行进一步训练,使模型适配特定任务或领域。Cohere推出全面的微调套件,其中包括生成微调、聊天微调、重新排序微调和多标签分类微调等解决方案,可以满足企业在微调各种AI应用时的需求。基于微调,企业可以定制模型,在文本生成、摘要、聊天、分类和企业搜索等目标用例上获得更好的性能。微调优势在于精准执行工业特定任务,但泛化能力较弱、可能过拟合,适用于借助高质量标注数据实现特定任务优化。比如工业领域的设备故障诊断、质量检测等特定场景可借助微调实现高精度。
RAG——Cognite外挂知识库降低幻觉
检索增强生成(RAG)在不改变模型参数的情况下,通过外挂行业数据库为大模型提供额外数据,支持工业知识获取和生成。Cognite利用RAG将大模型与其工业DataOps平台Cognite Data Fusion结合,将不同来源和类型的工业数据进行向量化并存储在专门向量数据库中作为RAG检索源,与用户自然语言提示一起输入到大模型中,使模型能提供更加精准的建议或解决方案。RAG优势在于快速利用外部信息资源、减少幻觉(即降低大模型生成虚假信息的概率),适用于快速结合数据库进行信息检索和输出,如工业设备维护问答、工艺参数查询等场景。三种构建模式分别适用于不同工业场景,企业可根据数据条件、预算和精度要求选择合适路径。