Gemini Omni : une nouvelle famille de modèles IA
Google a officiellement lancé la nouvelle famille de modèles d'intelligence artificielle Gemini Omni, avec pour première mouture le modèle Omni Flash. Cette annonce marque une étape majeure dans les capacités de génération de vidéos par Google, visant à créer « tout à partir de n'importe quel contenu » en combinant texte, photos, vidéos et audio. L'objectif affiché est d'étendre les compétences de raisonnement de Gemini à la création multimodale, s'inscrivant dans la continuité du succès du modèle de génération d'images Nano Banana, qui a produit plus de 50 milliards d'images depuis son lancement l'année dernière. Contrairement à Veo, le modèle vidéo précédent de Google qui fonctionne principalement sur le principe du texte vers la vidéo, Gemini Omni Flash se distingue par sa capacité à utiliser une vidéo existante comme point de départ pour en générer une nouvelle. Cette fonctionnalité permet aux utilisateurs d'insérer des images de leur propre visage dans des clips vidéo ou de modifier radicalement leur environnement. Nicole Brichtova, responsable de l'équipe produit en charge de Gemini, note que cette fonctionnalité répond à une demande forte des utilisateurs, déjà visibles dans l'usage massif de Nano Banana pour insérer des visages dans des images. Les clips générés par Omni Flash peuvent inclure du son et durer jusqu'à dix secondes, bien que Google travaille actuellement à augmenter cette durée. Selon Koray Kavukcuoglu, directeur technique de Google DeepMind, Omni Flash bénéficie d'une connaissance du monde plus vaste que Veo grâce aux données d'entraînement de la famille Gemini. Le modèle a été conçu dès le départ pour être nativement multimodal, permettant de fusionner différents types de médias en entrée pour produire une vidéo cohérente et riche. Une caractéristique distinctive de ce système est son interface de modification par conversation. Les utilisateurs peuvent instruire le modèle en langage naturel pour effectuer des changements spécifiques ou transformer l'intégralité d'une scène, avec une consistance maintenue entre les personnages et une logique physique préservée d'une instruction à l'autre. Le déploiement de Gemini Omni Flash débute dès ce mardi. Le service sera accessible immédiatement via l'application Gemini, l'outil Google Flow et YouTube Shorts. Google a indiqué que cette première version constituera le début d'une expansion plus large de la famille Omni, qui devrait à terme prendre en charge la génération d'autres modalités comme le son et les images. Cette sortie positionne Google comme un acteur clé dans la course aux modèles de création de contenu, offrant aux créateurs de contenu des outils puissants pour éditer et générer des vidéos de haute qualité sans nécessiter de compétences techniques complexes en montage traditionnel. L'intégration de ces capacités dans des plateformes grand public comme YouTube Shorts suggère une volonté d'immédiatement massifier l'accès à ces technologies avancées pour les utilisateurs quotidiens.
