【蚂蚁】蚂蚁集团AI大规模存储加速实践.pdf
1、蚂蚁集团AI大规模存储加速实践蚂蚁集团 刘键目录 大规模存储加速场景面临的问题 蚂蚁整体方案介绍 正在做的事&未来计划大规模存储加速场景面临的问题PART 1文件类型多,缓存加速需求不尽相同 如何同时满足各场景的需求文件类型文件大小数量读写操作性能需求图片1100K10亿100亿级顺序读延迟、QPS视频100M1G千万级随机读吞吐Checkpoint1G100GB百万顺序读、写延迟、吞吐NLP 文本10k100M千万级顺序读,随机读吞吐列存数据10M1G百万级顺序读,随机读吞吐元数据规模急速增长 如何应对大模型时代元数据规模的急速增长2022单次训练:千万文件+GB/TB级 数据集群规模:亿级
2、文件+50TB 数据2023单次训练:10亿文件+100TB 数据集群规模:50亿文件+500TB 数据2024单次训练:百亿文件+PB级 数据?集群规模:千亿文件+10PB 数据?和训练混部时的性能问题 部署上的变化 为了更好的利用率存储资源 同地域近端机房-同集群混部-同节点混部 大规模训练任务混部时的长尾和毛刺问题 随着训练任务规模的增大,单文件读取平均延迟增大,同时长尾问题越越来严重。020040060080010001200140010卡50卡200卡500卡平均延迟(ms)P75(ms)P90(ms)Failover时间长,线上运维成本高 节点重启时间长,导致线上运维难以操作、Fa
3、ilover 时间过长等 5 亿文件规模的集群,master初始化需要 12 小时。5 千万 block 的 worker 重启注册需要3小时,集群全量节点重启恢复需要 10+小时。多副本的成本高 多模态的训练数据已达百 TB 级,通过多副本提高服务 SLA 的额外存储成本过高。一般只为部分类型数据提供多副本能力,e.g.checkpoint。蚂蚁整体方案介绍PART 2蚂蚁缓存加速解决方案 多类型+多语言 API 自动预取优化 小文件折叠 基于联邦集群的元数据横向扩展 Follower read 支持单集群元数据扩展 Worker 异步注册,加快重启的恢复时间 云原生储存 分布式预热系统 弹





点击查看更多