爱心人寿刘帅:传统数据挖掘算法与AI大模型的协同范式.pdf
2025-09-13
文档编号:920121
文档页数:10
文档大小:709.61KB
下载积分:VIP专享
文档格式:PDF
1、传统数据挖掘算法与AI大模型的协同范式刘帅爱心人寿信息技术部门负责人场景:训练保险反欺诈预测模型 样本数据:100万案例 特征指标:100个 标签:欺诈Yes,非欺诈No问题引入梯度提升决策树(XGBoost)Vs AI大模型数据集特点异质数据集数据类型相同同质数据集数据类型多种,如数值、时间、类型等非结构化数据如文本、图像、声音等结构化数据(表格数据集 Tabular Data)模型数值试验-数据集n HELOC(FICO提供的信用风险评估数据,真实用户金融记录)n Adult Income(UCI人口普查数据,真实个人收入与人口统计信息)n HIGGS(高能物理数据,真实粒子对撞实验记录)
2、n Covertype(森林植被类型数据,真实地理与环境测量)n California Housing(加州房价数据,真实房产市场记录)相关数据和观点引自:Deep Neural Networks and Tabular Data:A Survey,Vadim Borisov 等模型数值试验-结果n 除超大规模的HIGGS数据集外,梯度提升决策树集成模型(如XGBoost、CatBoost)在中小型数据集、回归任务及多分类任务中均优于所有深度学习方法。n 训练数据质量差:不完整n 缺乏像图像/文本数据那样的显式空间(如像素邻接)或语义(如词序)关联,导致深度模型难以捕捉复杂特征交互n 预处理依





点击查看更多