从“机架级解耦”向“数据中心级解耦”演进、RDMA让GPU之间高速互联无需CPU参与、OGPU计算框架解决GPU生态兼容难题——异构算力调度正在成为智能算力服务的核心技术壁垒。中国信通院《智能算力服务研究报告》系统梳理了异构算力调度的关键技术群,揭示了从“算力孤岛”到“跨域协同”的技术突破路径。
异构算力调度的核心挑战
智能算力服务面临的核心技术难题是:如何将不同厂商(英伟达、AMD、华为昇腾等)、不同架构(GPU、NPU、FPGA)、不同地域的算力资源统一调度,为上层应用提供一致的服务体验。当前市场上芯片架构与软件生态较为封闭,企业若要在不同厂商的智算芯片间迁移模型,往往面临巨大的代码重构与适配成本。异构算力调度的目标,正是通过技术手段屏蔽底层差异,让算力资源像水电一样便捷可用。
统一资源管理框架——算网云调度系统
统一资源管理框架主要体现为构建算网云调度系统,类似于云计算的K8s集群编排调度系统,通过分层架构实现从资源管理到应用层的自动化编排。当前进展是攻关实现对异构算力、异构网络和跨云资源的统一调度,其调度能力直接决定了算力任务调度的规模和效率,是解决“调算力”难题的核心。
算网云调度系统通过统一的算力标识符、算网云调度操作系统和高性能传输协议,将分散、异构的资源在逻辑上整合为统一的“算力互联网”。实现跨主体、跨架构算力资源的标准化互联与感知,让算力交易采用“卡时(GPU-hour)”等标准化单位进行计量,促进了算力资源的高效供需匹配与流动。
任务画像与匹配算法——OGPU/ODPU框架
任务画像与匹配算法通过在应用层和底层硬件之间构建统一适配层,实现应用跨架构、跨主体的统一开发部署。当前进展是先通过发展兼容开放计算语言(OpenCL)、CUDA等主流生态的OGPU(One-GPU)计算框架和ODPU(One-DPU)开发框架解决GPU生态兼容的难点,然后通过统一接口简化应用部署,最终提高“用算力”的计算部署效率。
这种统一适配层的设计理念,使得开发者无需为不同芯片厂商编写不同代码,一次开发即可在多种异构算力平台上运行,大幅降低了应用迁移和部署的成本。
资源解耦与CXL技术
资源解耦打破了服务器以CPU为中心的封闭架构,将计算、存储、内存等硬件部件独立封装,通过高速总线互联,根据业务需求动态组合硬件资源。CXL(Compute Express Link)技术是目前最大的突破点,它提供了内存一致性的高速互联标准。业界正在从“机架级解耦”向“数据中心级解耦”演进,旨在构建完全可组合的基础设施。
资源解耦的价值在于解决大模型训练中的“内存墙”和“显存墙”问题。通过将内存资源池化,大模型训练可以按需获取远超单个服务器物理限制的内存容量,从而支持更大规模的模型训练。
RDMA与SRv6高速网络技术
远程直接内存访问(RDMA)允许一台计算机的内存直接访问另一台计算机的内存,无需操作系统内核参与,释放了CPU算力并大幅降低通信时延。目前以RoCEv2(RDMA over Converged Ethernet)协议为主流,在高性能计算和大规模AI集群中,RDMA已成为GPU之间高速互联的标准配置,显著解决了分布式训练中的通信瓶颈。
基于IPv6的段路由(SRv6)基于源路由理念,将网络路径和指令编码在IPv6报头中。它不仅能指定数据包的传输路径,还能携带算力信息和服务指令,实现网络的可编程性。SRv6在算力网络骨干网调度中应用,实现基于骨干网直联点和新型互联网交换中心的算力交换和寻址。中国电信和华为联合开展的百公里级AI广域网试验,通过突破性应用广域RDMA技术,将跨域训练任务时延压至1.1毫秒。