NVIDIA機密計算で高性能プライベートAI推論を実現
NVIDIAは、機密コンピューティング環境下で高パフォーマンスな大規模言語モデル推論を実現する技術動向を公表した。規制産業や企業が扱う機微なデータ保護を目的とするNVIDIA Confidential Computingは、メモリ暗号化仮想マシンと機密GPU、暗号化NVLinkで構成される。しかし機密環境ではメモリ転送やスケジューリング、マルチGPU通信のランタイム前提が変化するため、最適化を行わなければ推論性能が低下する懸念があった。 NVIDIAはBlackwell搭載DGX B200環境でTensorRT LLMの対応検証を実施した。DeepSeek-R1モデルを用い、長コンテキストと低並列条件で負荷を集中させて機密有効時と無効時の差を測定した結果、出力スループットは無効時の96.1%から98.2%を維持した。トークン生成遅延も1.2%から4.3%に収まった。 この結果は、ランタイム側のアーキテクチャ適応による。GPUが保護メモリに直接アクセスできない環境では、ホストからデバイスへの転送を跳躍バッファ経由で再設計した。カーネル自動チューニングのタイミング不安定化にも対応し、NVLSマルチキャストが利用できない環境では通信プロトコルを最適化することで同期コストを最小限に抑制した。 同社では、セキュリティ設定と推論最適化は統合エンジニアリング課題として扱うべきと指摘する。実際の本番投入に際しては、環境証明を実施した上で、実タスクと同一条件でベンチマークを実施し、オーバーヘッドを定量化する工程を推奨している。これにより、企業は機密性を損なわず高性能なAI推論基盤を本番環境へ展開できる。
