百度智能云Cosmos 3异构集群训练实践落地:同等预算下系统吞吐提升35%
随着世界模型、具身智能和生成式模型等新一代AI基础模型快速发展,大模型训练的优化重心正在从单一模型计算效率转向整个训练系统的工程效率。近日,百度智能云技术团队在Cosmos 3模型训练中完成了异构集群训练加速实践——基于百度百舸平台,以1台主流GPU节点搭配2台低成本GPU节点组成异构训练集群,在约1.5倍硬件投入下将训练吞吐从21.6 samples/s提升至45 samples/s,同等预算下系统吞吐提升约35%,且训练精度无损。
训练瓶颈从模型转向流水线
长期以来,大模型训练优化主要围绕模型前向、反向传播和参数更新展开。百度智能云技术团队此前已在百度百舸平台上完成了Cosmos3-Nano-Policy-DROID(16B参数规模)的全链路训练调优,单机吞吐提升99.3%,MFU达到0.42;随后将模型升级至64B参数规模的Cosmos3-Super,在512卡规模下扩展效率保持在97.48%。
然而,随着世界模型和视频生成类模型的训练流程发生变化,新的瓶颈浮出水面:视频数据在进入模型训练前需要经过VAE Encoder进行压缩编码,而这一前置计算占整个前向计算时间约76%,且在训练GPU内部已无优化空间——编码期间GPU算力接近满载,计算完全串行。

异构架构:训练与编码彻底解耦
针对这一瓶颈,百度智能云技术团队重新设计了训练架构,将VAE编码从训练节点中解耦,独立部署到由低成本GPU实例构成的编码集群上。训练节点专注于模型训练,编码集群负责视频编码并返回Latent表示,两条计算链路通过数据交换协同工作。
为确保训练侧与编码集群高效协同而非彼此等待,团队将传统以Batch为单位的串行流程重构为流式处理:数据发送、编码和结果回填三条链路完全并行运行,多个Batch同时在流水线中流动,编码时间被完整隐藏进训练的反向传播与优化器阶段。
在集群调度层面,团队设计了全局动态调度机制,取消了训练节点与编码节点之间的固定绑定关系,任意编码节点均可服务任意训练节点。实测中,40个编码节点全部接收到均匀流量,单节点请求数偏差为零。
此外,团队在编码节点上建立了两级本地缓存机制,确保相同输入只编码一次。在训练loss验证中,异构编码集群版本与基线版本呈现完全一致的收敛趋势,验证了优化的无损性。
在底层算子优化层面,团队通过整图预编译、卷积算法自动选优和基于CUTLASS的定制卷积算子,将单次编码时间从512ms降至275.5ms,编码效率提升1.86倍。
AI Infra优化进入系统级阶段
此次实践表明,AI Infra工程优化的对象正在从单个模型扩展到整个训练流水线。通过科学的资源分层配置,利用成本更低的编码节点承接前置计算、释放昂贵训练节点的算力,可以在不依赖单纯扩容GPU的情况下显著提升整体投入产出比。该异构架构方案同样适用于图像Tokenizer、各类特征提取器等"冻结、轻量、无通信依赖"的前置计算场景。
百度智能云表示,对于AI Infra而言,真正需要优化的不只是模型本身,而是模型背后的整个训练系统。相同预算下多获得35%的训练吞吐,意味着企业可以用相同成本更快地完成模型迭代,加速从研发到落地的进程。