エッジ向けマルチモーダル判断モデルd1公開
Liquid AIは本日、エッジデバイス向けに最適化されたマルチモーダル決定モデル「d1-3B」と「d1-omni-600M」をオープンソースで公開した。両モデルは同社の基盤モデルであるLiquid Foundation Modelsを基盤としており、従来の生成AIとは異なり、トークンを逐次出力するのではなく単一の順伝播処理で構造化された回答を即座に生成する。 性能面では、d1-3Bは読解力、毒性検出、意図分類、医療QA、多言語理解を含む7つの公開データセットで平均82.9点を達成し、同サイズ枠の既存決定モデルを凌駕した。一方、実験段階のd1-omni-600Mはパラメータ数を既存モデルの4分の1に抑えながら平均78.4点を記録し、パラメータ効率性を大幅に向上させた。d1-3Bは視覚認識能力を継承しており、d1-omni-600Mはテキスト、画像、音声の3モダリティに対応する。 NVIDIAとの共同検証により、RTX 4090およびJetsonシリーズ上での推論速度が確認された。d1-3Bはエッジデバイスにおいて単一質問への応答を50ミリ秒以内、GPU環境では10ミリ秒以内で完了する。画像処理も18ミリ秒以下に収まり、低遅延が求められるリアルタイム意思決定タスクに適合している。 両モデルはHugging Faceにて公開され、transformersライブラリを介して容易に導入可能である。テキスト分類や画像認識、バッチ処理された複数のリクエストへの同時応答など、高速で構造化された決定が求められる業務フローへの組み込みが想定される。開発チームは、エッジ環境における軽量かつ高精度なAI決定基盤の普及を期待している。
