HyperAIHyperAI

Command Palette

Search for a command to run...

Google、何事も作成可能な「Gemini Omni」新 AI モデルを発表

Google は 2024 年、テキスト、写真、動画、音声など多様な入力からあらゆるものを生成できる AI モデル「Gemini Omni」を発表しました。このファミリーの第一弾として公開される「Omni Flash」は、既存の画像生成モデル「Nano Banana」の動画版にあたる機能を提供します。同モデルは最大 10 秒間の動画と音声の生成に対応し、動画や画像を入力基盤として別の動画を生成する能力を備えています。Google DeepMind のディレクター兼 CTO は、動画生成モデル「Veo」と比較して、Gemini のトレーニングデータに基づく膨大な世界知識を有している点を強調しています。また、開発チームの責任者であるニコル・ブリストヴァ氏は、Nano Banana で写真への人物像の挿入が頻繁に利用されているのと同様、動画内へのユーザーの顔の挿入など、新しい創作の可能性が期待されると述べています。生成された動画は、自然言語による会話形式で詳細な編集が可能で、キャラクターの整合性や物理法則の維持、シーン前後の記憶保持など、高度なコントロールを実現します。Gemini Omni Flash は、発表直後の火曜日から Gemini アプリ、Google Flow、YouTube Shorts で利用可能となり、今後は画像や音声などの他の出力形式への対応も予定されています。これにより、Google は Gemini が持つ推論能力と創造能力を融合させ、ユーザーが現実には撮影不可能な映像を簡単に創出できる環境を整備しました。

関連リンク

Google、何事も作成可能な「Gemini Omni」新 AI モデルを発表 | 人気の記事 | HyperAI超神経