HyperAIHyperAI

Command Palette

Search for a command to run...

FLUX 3 早期アクセス開始 多モーダル視覚AI

FLUX開発チームは、画像・動画・音声を統合学習するマルチモーダル基盤モデル「FLUX 3」の早期アクセスを開始した。同モデルは各モダリティを独立させず、統一アーキテクチャ内で物理法則や因果関係を内在させるSelf-Flow技術を採用。大規模コンピュートとデータにより、映像・画像・音声の共同生成・理解を可能にした。 機能面では、テキストまたは参照入力から20秒以内の音声付動画を生成。表情表現や物理現象と音の同期、多言語対応に優れ、参照画像によるシーン横断のキャラクター一貫性も確保する。画像領域では複雑プロンプトの高精度処理と多言語テキスト描画を実現。さらに行動予測能力も備え、動画バックボーンを基盤にロボット制御など限られたデータでファインチューニング可能なダイナミクス対応モデルへ展開可能だ。mimic roboticsとの共同モデル「FLUX-mimic」は精密マニピュレーションや独逸Audiでの実証テストに進出している。 初期評価ではRunwayやLuma、Kling等の競合に対し映像品質と物理的一貫性で高い支持を集めた。FLUXチームは今後の段階的リリースに向け安全性試験とフィードバック収集を実施。並行して技術詳細の公開や、知覚・行動・言語を完全統合した次世代モデルの開発を進行中。米州と独州での採用を拡大中であり、開発者や企業パートナーの参画を呼びかけている。

関連リンク