智能驾驶云端全链路优化实践-茅俊杰.pdf
1、智能驾驶云端全链路优化实践阿里云智能集团资深技术专家茅俊杰智驾业务背景 数据全链路挖掘训练生产采集数采车、测试车、量产车定制采集,离线/实时点云、GPS里程、视频等FFmpegX265图像抽帧雷达信息预训练多模型标注向量化去重分析挖掘Spark/Ray大规模分布式训练视觉模型、CV模型、智驾模型端到端模型、世界大模型等场景库构建;原ISSUE数据生产;corner case大规模并发仿真;LogSim等CI、CD版本管理、项目管理OTA升级端侧智驾推理车+云结合决策数据采集预处理数据标注数据挖掘模型训练仿真验证集成部署车端集成数据闭环面临通用技术挑战1.数据的质量和准确性是实现有效数据闭环的基
2、础2.数据量的庞大以及实时性要求对计算和存储提出了巨大的挑战3.数据标注和模型训练过程的挑战需要不断优化和完善训练模型4.数据闭环的跨系统协同数据闭环核心流程1.数据闭环通过采集、挖掘、管理、生产,实现数据-算法-性能的正向循环2.当前行业年数据量超EB级,而头部企业已通过数据闭环实现30%-50%的成本降低与性能提升。3.特斯拉FSD:依托影子模式实时采集数据,全球车队累计行驶里程超100亿英里数据闭环是推动智能驾驶技术不断进步和优化的核心驱动力覆盖数据挖掘、模型训练、云端推理的OS、中间件、训推框架全栈优化面向智能驾驶场景的基础软件优化技术内存占用优化算子加速向量化API扩展OS+Drag
3、onwellOS 资源调控模型编译分布式推理调度策略优化内存管理优化与碎片化治理区域编译计算、通信调度P/D分离提升吞吐高可用sgl-router 热备份面向数据挖掘与向量数据库的OS+Dragonwell优化10%10%20%内存占用优化OS+JVM协同,避免同时申请大量内存造成性能颠簸算子加速优化BigDecimal的核心算法关键函数Native替换向量化API扩展贡献向量化的compress/expand等API实现OS 资源调控改善CPU瓶颈针对智能驾驶模型训练场景,系统化地优化配置CPU频率、进程CPU亲和性及调度策略,确保训练任务在资源充分、无干扰的环境下高效稳定运行,典型开源模型





点击查看更多