FLUX 3 et mimic déploient un modèle vidéo-action chez Audi
Black Forest Labs et la société de robotique mimic ont dévoilé FLUX-mimic, un modèle vidéo-action de nouvelle génération reposant sur leur modèle de base multimodal FLUX 3. Cette collaboration fusionne la création de contenu et l'intelligence physique sous une seule architecture fondatrice. Alors que les versions précédentes se limitaient à la génération d'images, FLUX 3 apprend simultanément les dynamiques visuelles, audio et physiques, posant les bases d'un réseau capable de comprendre et d'interagir avec le monde réel. Le principe central de FLUX 3 repose sur l'apprentissage conjoint de la vidéo, de l'audio et des actions robotiques. La prédiction vidéo, qui représente plus de 95 pour cent des coûts informatiques, oblige le modèle à maîtriser les lois de la physique, du mouvement et des causes à effets. Grâce à une méthode appelée Self-Flow, les chercheurs unifient l'apprentissage génératif et l'extraction de représentations. Cette approche permet de décoder les commandes robotiques directement depuis les couches intermédiaires du réseau, sans compromettre la qualité de génération visuelle ou auditive. Une fois la structure de l'espace d'action assimilée, le modèle retrouve sa performance initiale tout en gagnant la capacité de piloter des machines. Les tests en environnement industriel, notamment chez Audi, ont validé cette architecture sur des tâches de fabrication exigeantes : assemblage de composants, insertion de modules électroniques dans des supports serrés et manipulation de pièces souples comme les câbles ou les joints. Contrairement à l'automatisation traditionnelle, incapable de gérer la flexibilité et la diversité des variantes de production, FLUX-mimic s'adapte grâce à sa compréhension profonde des interactions physiques. Les benchmarks confirment qu'il dépasse les modèles vision-langage-action existants, même avec un réseau gelé, et atteint les meilleurs taux de réussite en fine-tune. Au-delà des performances brutes, le système se distingue par son efficacité et sa robustesse. Le modèle apprend avec dix fois moins de données de démonstration que ses prédécesseurs et possède une capacité naturelle à se corriger après une erreur de préhension, une autonomie issue directement de sa représentation du monde physique. La latence a également été optimisée pour répondre aux contraintes temps réel. Grâce à une représentation plus dense, le réseau peut être réduit en taille tout en conservant ses capacités, permettant une inférence de moins de 80 millisecondes sur un seul GPU NVIDIA RTX 5090. Intégrées aux optimisations logicielles de mimic, ces performances offrent un temps de réaction global du système de 101 millisecondes, proche du réflexe visuel humain. Cette architecture démontre que l'intelligence visuelle et la robotique physique ne nécessitent plus de fondations distinctes. En transférant les connaissances du monde physique directement dans le réseau de base, Black Forest Labs et mimic ouvrent la voie à une automatisation flexible et économique. Le déploiement chez Audi marque une étape concrète vers la validation de ces innovations en production réelle, promettant de transformer la gestion des chaînes d'assemblage et de logistique en réduisant la dépendance aux programmations manuelles rigides.
