HyperAIHyperAI

Command Palette

Search for a command to run...

DFlashでNVIDIA Blackwell推論性能を15倍加速

人工知能のマルチエージェントワークフロー普及に伴い、低レイテンシ推論の重要性が急増している。カリフォルニア大学サンディエゴ校が2026年2月に公開したオープンソース推論最適化フレームワークDFlashは、NVIDIA Blackwell GPU上で最大15倍の推論性能向上を実現し、業界の注目を集めている。 従来の自己回帰型大規模言語モデルはトークンを逐次生成するためGPU利用率が制限される傾向がある。DFlashはブロック拡散に基づく推測的デコード技術を採用し、このボトルネックを解消する。軽量なブロック拡散ドラフターが単一の前向きパスで複数トークンからなる候補ブロックを並列に生成し、ターゲットモデルがそれを並列検証する。この設計により逐次ワークを並列計算に転換し、Blackwellアーキテクチャの15 PFLOPS NVFP4演算性能や10 TB/sのチップ間インターコネクトを効率的に活用できる。 実証結果では、gpt-oss-120bをNVIDIA DGX B300システムで推論する場合、対話速度500〜600トークン/秒の目標値において自己回帰デコードに対しスループットが15倍以上向上した。Llama 3.1 8Bでは既存手法EAGLE-3と比較して対話速度をほぼ2倍に引き上げている。コーディング、RAG、推論、要約、多言語処理などSpeed-Benchの全タスクにおいて均一に高い性能改善を示し、並列性と検証プロセスの最適化が実環境でのレイテンシ制約を確実に緩和していることが確認された。 技術は直ちにNVIDIA GPUエコシステムに統合されている。現在Hugging Face上で20種のモデルチェックポイントが公開され、Qwen、Kimi、Llama、Gemma、gpt-ossなどの主要モデルファミリーに対応。推論フレームワークvLLM、SGLang、TensorRT-LLMへのネイティブサポートにより、開発者は設定ファイルの変更のみで容易に移行可能であり、アプリケーションのリファクタリングは不要である。vLLMにおけるGemma 4 31BやSGLangにおけるQwen3 8Bの実験でも、同じ同時実行数条件下で自己回帰デコードに対し最大5倍以上のスループット向上が記録されている。 DFlashはGPUメモリの転送ボトルネックが支配的なデコード領域において、計算資源のより高い利用率を可能にする。マルチエージェントAIやリアルタイム対話アプリケーションが求める厳格なユーザー間レイテンシを維持しながらスケーラビリティを大幅に向上させる手法として、標準推論スタックへの急速な組み込みが業界で進められている。

関連リンク