HyperAIHyperAI

Command Palette

Search for a command to run...

Gemini Omni: Neue KI-Modellfamilie für alles

Google hat eine neue Familie von Generierungs-KI-Modellen unter dem Namen Gemini Omni vorgestellt, die darauf abzielt, aus beliebigen Eingabeformaten Inhalte zu erschaffen. Als erstes Mitglied der Reihe wurde Gemini Omni Flash eingeführt, das es Nutzern ermöglicht, Videos aus Text, Fotos, Audio und anderen Videoclips zu generieren. Der Name Omni spiegelt die Vision des Unternehmens wider, in Zukunft jede Art von Inhalt aus jeder Eingabeart erzeugen zu können. Gemini Omni Flash wird als Video-Äquivalent zum bereits bekannten Bildgenerierungsmodell Nano Banana positioniert, das seit seiner Einführung im vergangenen Jahr mehr als 50 Milliarden Bilder erstellt hat. Nutzer können beispielsweise ihren eigenen likeness in Videos einfügen, eine Funktion, die in der Bildbearbeitung bereits etabliert ist. Das System erzeugt Video- und Audioausschnitte mit einer Länge von bis zu zehn Sekunden, wobei Google an der Erweiterung dieser Dauer arbeitet. Im Gegensatz zu Veo, dem bestehenden Text-zu-Video-Modell von Google, erlaubt Omni Flash die Verwendung von existierenden Videoclips als Basis für die Generierung neuer Inhalte. Koray Kavukcuoglu, CTO von Google DeepMind, betont, dass das neue Modell durch das umfangreiche Trainingsdaten des Gemini-Systems über ein breiteres Weltwissen verfügt. Dies ermöglicht die Erstellung von hochwertigen Videos, die auf realen Fakten basieren und komplexere Zusammenhänge berücksichtigen. Die Funktionen von Gemini Omni Flash umfassen eine intuitive Videobearbeitung durch natürliche Sprache. Nutzer können Änderungen an Szenen, Charakteren oder physikalischen Regeln durch einfache Anweisungen vornehmen, wobei das Modell Kontinuität und Konsistenz über mehrere Bearbeitungsanweisungen hinweg wahrt. Das System fungiert als Ausgangspunkt für kreative Szenarien, die in der Realität nicht gefilmt werden könnten. Der Launch erfolgt ab dem laufenden Dienstag über die Gemini-App, Google Flow und YouTube Shorts. Langfristig plant Google, weitere Ausgabeformate wie Bilder und Audio zu unterstützen, um die Vielseitigkeit des Modells weiter zu erweitern. Die Einführung markiert einen weiteren Meilenstein in der Entwicklung multimodaler KI-Systeme, die sowohl logisches reasoning als auch kreative Erstellung kombinieren.

Verwandte Links

Gemini Omni: Neue KI-Modellfamilie für alles | Aktuelle Beiträge | HyperAI