HyperAIHyperAI

Command Palette

Search for a command to run...

NVIDIA、エージェントAI向け高速モデルとルーティング技術公開

NVIDIAは、自律型AIエージェントの需要が高まる中、Nemotron 3シリーズを「Nemotron 3.5 Lightning」と「NeMo Switchyard」で強化したと発表した。新モデルのNemotron 3.5 Lightningは、300億パラメータの混合専門家(MoE)アーキテクチャを採用したオープンソースモデルであり、常駐型エージェント向けに最適化されている。ベンチマークではトークン生成速度が最大4倍向上し、タスク完了までが従来クラス比30%短縮。オープンウェイトであるため、企業や開発者は自社のドメインデータやワークフローに合わせたポストトレーニングが容易で、カスタマイズ性は極めて高い。 展開環境は多岐にわたり、NVIDIA RTX PC、DGX Spark、Jetsonなどのローカルおよびエッジ環境から、DGX Station、データセンター、クラウドまで柔軟に対応可能。開発エコシステムとも連携を深化させ、vLLMやOllama、llama.cpp、LM Studio、Unslothなどが最適なデプロイ体験を提供。これにより、開発者はNVFP4やGGUF形式の選択が可能になり、ローカルでの高効率なエージェント構築が実用段階に達している。 同時に公開されたNeMo Switchyardは、エージェントワークフロー内のリクエストを最適化されたモデルへ自動的にルーティングするオープンソースライブラリである。単一モデルの依存によるコスト増や精度低下を防ぎ、タスクの特性に応じて品質、レイテンシー、コストのバランスを調整可能だ。社内ベンチマークでは、Opus 4.8単体使用時の約3分の1のコストでフロントティア級の精度を維持し、トークン経済の効率化を牽引している。 これらの技術は、NVIDIAが推進するローカルAIおよびオープンエコシステムの一環として位置づけられ、Hugging Face、ModelScope、OpenRouter、GitHub、build.nvidia.com、および主要クラウドパートナーを通じて公開されている。エージェント基盤の分散化と制御可能性を高め、企業規模のエッジAIから個人開発者のローカル環境まで、次世代の自律型AI運用を支援する基盤が整備された。

関連リンク