英伟达ModelExpress加速模型权重分发
英伟达近日推出ModelExpress框架,旨在重构大模型权重分发流程,突破集群扩容与冷启动的性能瓶颈。随着模型参数规模突破百GB乃至TB级,传统通过对象存储或本地磁盘读取权重的模式引发大量冗余I/O,严重拖慢服务上线与在线强化学习更新效率。 ModelExpress的核心机制为按需就近分发。框架启动时优先探测集群内已加载兼容权重的推理节点,借助NVIDIA Inference Xfer Library直接通过P2P RDMA实现显存到显存的高速直传,彻底绕过对象存储、本地磁盘及主机内存。若无可用节点,则通过Model Streamer从远程存储直连GPU,或启用GPUDirect Storage技术读取本地磁盘。此外,该框架整合内核缓存继承技术,使新节点直接复用已编译的JIT Kernel与CUDA图,规避重复预热。针对强化学习的频繁权重更新,MX提供接收方驱动的Refit机制,实现训练端到推理端的低延迟同步。 实测数据显示,在部署DeepSeek-V4 Pro模型时,ModelExpress可将单节点权重拉取压缩至10秒内,整体冷启动时间由8分钟骤降至1分44秒。该工具已原生支持vLLM、SGLang及Dynamo等主流推理引擎,大幅降低集群网络带宽竞争与存储开销,为大规模AI服务弹性伸缩与高频训练迭代奠定关键基础设施。
