NVIDIA Vera Rubin NVL72、AI電力効率を30倍に向上
NVIDIAはAIエージェント向け推論プラットフォームVera Rubin NVL72のパフォーマンスデータを公開し、エネルギー効率性における新たな基準を確立した。SemiAnalysisのエージェント用ベンチマークAgentXによる実データ計測では、Vera Rubin NVL72がGB300 NVL72に対し1メガワットあたりの推論スループットで最大30倍の性能を発揮することが明らかになった。100兆トークン規模の実際の利用統計によれば、エージェントワークロードはチャット対話の平均15倍のトークンを消費する。複数回の推論ステップ、ツール呼び出し、サブエージェントの協調、そして蓄積する長文脈処理がこの負荷特性を形成しており、従来の固定長シーケンス評価では捉えきれない本番環境の負荷をAgentXは再現・評価している。 AgentXの計測では、実際のコーディングエージェントセッションを記録再生し、KVキャッシュの再利用やインタラクティブ応答遅延を統合的に評価している。その結果、Vera Rubin NVL72は1ユーザーあたり160トークン/秒という対話性能を維持しながら、電力制約下のAIファクトリにおける処理能力を大幅に向上させた。推論コスト面では、百万トークンあたりの費用がGB300 NVL72に対し最大35倍低減し、大規模運用における収益性を牽引する。同世代比較ではGB300 NVL72がH200 NVL8に対し15倍の高いスループットと10倍のコスト削減を実現している。 この性能飛躍の基盤にはハードウェアとソフトウェアの協調設計がある。Vera Rubin GPUの強化されたTensorコア、NVFP4量子化、72基のGPUを統合するNVL72スケールアップドメインは大規模MoE推論に最適化されている。第六世代NVLinkおよび専用スイッチは低遅延のGPU間通信を実現し、TensorRT-LLMやDynamoなどのランタイム、セッション対応ルーティング技術と連動して効率を最大化している。またVera CPUやBlueField-4 DPU、ConnectX-9 SuperNICなどラック全体を統合したアーキテクチャは、エージェントのツール実行とコンテキスト管理を分業処理することで再計算と待機時間を大幅に削減する。NVIDIAは継続的なソフトウェア最適化により両プラットフォームの性能がさらに向上すると表明しており、Vera RubinはエージェントAIの本格商業化におけるスケーラブルで経済的なインフラ基盤の到達点を示すものとなった。
