HyperAIHyperAI

Command Palette

Search for a command to run...

全栈推理与训练优化提升人工智能工厂能效

随着人工智能数据中心迈向百兆瓦至吉瓦级规模,电力成本已占运营支出的四成左右,且受限于区域供电上限,每瓦性能成为决定模型推理与训练成本的核心指标。为此,英伟达发布覆盖芯片、软件与基础设施的全栈能效优化方案,旨在通过极致协同设计最大化人工智能工厂的每瓦产出。 在推理侧,系统通过采用混合专家架构与NVFP4低精度格式,在维持同等精度前提下显著削减能耗。GB200 NVL72机架系统结合直冷液冷与机架内功率平滑技术,有效抑制电流尖峰,使运营商能在固定电力预算内部署更多计算单元。配合Dynamo与TensorRT-LLM软件栈,推理吞吐与复杂模型响应速度得到全面跃升。 训练侧能效优化同样取得突破。英伟达联合密歇根大学研究团队,在开源训练框架Megatron-LM中引入协同频率调节技术。该方案依据任务关键路径动态分配算力,使负载较轻的图形处理器降速运行以消除闲置功耗。实测数据显示,该策略可在基本不延长端到端训练周期的条件下,将大模型训练总能耗降低约四分之一。 为统筹全局调度,英伟达推出AI工厂级管理平台DSX。其内部模块支持四十五摄氏度高温液冷与动态功率重分配,实时回收闲置算力;外部网关模块则实现厂区微电网与公共电网的智能互联。全栈技术协同作用下,优化后的数据中心每兆瓦每秒令牌生成量最高可达未优化系统的二点六倍。行业分析指出,未来应以模型经济性为核心设计导向,结合数字孪生与基准测试,将电力容量约束彻底转化为算力与营收的护城河。

相关链接

全栈推理与训练优化提升人工智能工厂能效 | 热门资讯 | HyperAI超神经