FLUX 3 : modèle multimodal unifié en accès anticipé
L'équipe derrière la famille de modèles FLUX a annoncé la disponibilité en accès anticipé de FLUX 3, un nouveau modèle multimodal fondamental conçu pour percevoir et interpréter le monde de manière unifiée. Contrairement aux approches traditionnelles qui traitent séparément les images, les vidéos et l'audio, FLUX 3 apprend simultanément à partir de ces trois modalités au sein d'une seule architecture. Cette approche repose sur le constat que chaque canal sensoriel ne capture qu'une projection partielle de la réalité. En les combinant, le modèle doit résoudre des contraintes croisées, comme l'alignement entre le son d'un impact et son mouvement visuel, ce qui lui permet de développer une compréhension plus cohérente de la physique et des causalités. Développé à l'aide de la méthode Self-Flow, qui aligne efficacement la génération et la compréhension multimodales, FLUX 3 intègre des ressources de calcul et de données considérablement accrues. Ses capacités couvrent trois axes principaux. Pour la vidéo, le modèle génère des clips jusqu'à vingt secondes incluant un audio natif synchronisé. Il excelle particulièrement dans la reproduction des expressions faciales, l'association précise des bruits aux événements physiques et le maintien de la cohérence des personnages sur plusieurs scènes. Il gère également le multilinguisme. Dans le domaine de l'image, FLUX 3 permet la synthèse et l'édition dans divers styles et formats, avec une précision notable pour le rendu de textes complexes dans plusieurs langues. Enfin, le modèle étend sa compréhension du monde à la prédiction d'actions, ouvrant la voie à l'intelligence artificielle physique. En collaboration avec mimic robotics, l'équipe a intégré cette technologie dans FLUX-mimic, un prototype dédié à la manipulation robotique de précision et à son déploiement industriel, notamment testé sur des lignes de production. Les évaluations préliminaires confirment la compétitivité du système. Lors de comparaisons directes, FLUX 3 a été préféré à des solutions établies comme Runway Gen-4.5 dans 77 % des cas, à Luma Ray 3.2 dans 93 % des cas, ainsi qu'à Grok Imagine Video, Kling v3 Pro et Seedance 2.0. Ces résultats restent provisoires et devraient s'améliorer durant la phase d'accès anticipé. L'entreprise prévoit un déploiement progressif sur les prochaines semaines, accompagné de tests de sécurité rigoureux et de la publication prochaine de détails techniques. Le développement de la génération suivante est d'ores et déjà entamé, avec l'objectif de fusionner dans un même moteur la perception, la prédiction d'actions et le raisonnement linguistique. Les équipes recrutent activement en Allemagne et aux États-Unis pour accélérer ces recherches.
