申敏-蚂蚁代码大模型的评测实践.pdf
1、蚂蚁代码大模型的评测实践申敏 蚂蚁集团演讲嘉宾申敏 蚂蚁集团-测试开发专家蚂蚁集团测试开发专家,研究方向:大模型在代码领域的评测技术。长期投入蚂蚁支付、账务、计收费等业务领域质量保障工作,熟悉企业级编码风格及要求,当前,负责蚂蚁百灵大模型CodeFuse系列的代码能力评测。目 录CONTENTS1.前言2.代码大模型的评测内容3.代码大模型的评测方法4.代码大模型的评估基准5.代码大模型多任务评估6.展望前言PART 01前言:模型发展与模型评估2023年大模型呈爆发式增长,截至2023年7月,中国累计有130个大模型问世,国外大模型138个,其中,美国大模型114个。赛迪顾问IT2023模型
2、发布必然离不开模型评估;AIGC编程是模型落地最为广泛的场景之一,充分衡量方能更好的运用or选用。前言:CodeFuse 让研发变的更简单CodeFuse 是一款为国内开发者提供智能研发服务的产品,该产品是基于蚂蚁集团自研的基础大模型进行微调的代码大模型。CodeFuse 具备代码补全、添加注释、解释代码、生成单测,以及代码优化等功能,以帮助开发者更快、更轻松地编写代码。官网:https:/ 模型:旨在支持整个软件开发生命周期的大型代码语言模型(Code LLMs),涵盖设计、需求、编码、测试、部署、运维等关键阶段。https:/arxiv.org/abs/2311.02303https:/a
3、rxiv.org/abs/2310.06266 CodeFuse系列论文:业界开源评测集上的roadmap前言:大模型时代如何评估代码大模型通用 代码(垂类)跨项目编码等任务多样可信:多样:多维:代码能力、基础能力、安全能力等多维度多编码语言、编码规范、样本纯净、标准开放、客观中立伴随蚂蚁代码大模型的投产,我们发现代码领域打榜与实际投产存在一定的差异,基于此,我们探索并构建了适合企业项目的代码大模型的评测范式。代码大模型的评估内容PART 02代码大模型的评估内容基础能力编码领域无害确定安全生成理解使用认知能力发现衡量评估应用与改进通过评估内容客观衡量代码大模型的各项能力,发现其长处和短处,反





点击查看更多