HyperAIHyperAI

Command Palette

Search for a command to run...

World Labs dévoile Atlas, modèle unifié 3D, vidéo et robots

Récemment, World Labs, l’entreprise spécialisée en intelligence spatiale fondée par la chercheuse en IA Li Feifei, a présenté Atlas, un nouveau modèle d’apprentissage profond qu’elle qualifie de premier modèle mondial multimodal. Entraîné entièrement à partir de zéro, Atlas vise à unifier la génération vidéo, la reconstruction 3D et la simulation spatio-temporelle au sein d’une seule architecture, dépassant ainsi l’approche conventionnelle qui traite ces tâches de manière isolée. Contrairement aux générateurs vidéo actuels qui opèrent principalement dans l’espace des pixels, Atlas intègre directement la position et l’orientation de la caméra comme données natives. Cette caractéristique permet au système de construire un contexte spatial cohérent, garantissant une continuité visuelle lors des déplacements virtuels du point de vue. Les utilisateurs peuvent ainsi contrôler précisément les trajectoires de caméra pour produire des séquences vidéo de haute résolution, ou reconstruire des scènes 3D fidèles à partir de quelques images simples. Le modèle génère directement des nuages de points et des scènes exploitables via le Gaussian Splatting, facilitant leur intégration dans les workflows existants du jeu vidéo, de l’architecture ou des effets visuels. Au-delà de la création de contenu, Atlas cible directement l’entraînement des robots. En reconstruisant un environnement à partir de simples enregistrements vidéo capturés par smartphone, le modèle peut simuler le comportement visuel et profond d’un robot se déplaçant dans cet espace virtuel. Cette approche Real-to-Sim, ou passage du réel à la simulation, ambitionne de réduire considérablement les coûts et la complexité associés à la collecte de données pour la robotique, rendant possible la création de terrains d’entraînement à grande échelle avec du matériel grand public. Architecturalement, Atlas repose sur un transformateur multimodal combinant des mécanismes autoregressifs et de diffusion. Cette hybridation lui permet de traiter simultanément du texte, des images, des données 3D et des poses de caméra au sein d’un même flux séquentiel. World Labs prévoit d’intégrer cette technologie comme fondement de sa plateforme de génération de mondes 3D Marble. Cette annonce s’inscrit dans une course croissante au développement de modèles mondiaux, avec des initiatives parallèles de Google DeepMind et de Nvidia. Toutefois, le terme premier modèle mondial reste sujet à débat au sein de la communauté scientifique. Atlas présente une avancée notable dans l’unification des tâches visuelles et spatiales, mais il ne simule pas encore la physique complexe du monde réel. Des défis majeurs persistent, notamment la résolution du fossé entre la simulation et la réalité physique, ainsi que la validation indépendante des performances à long terme. Le modèle n’est actuellement disponible qu’en accès anticipé pour un cercle restreint de partenaires, et aucun poids ni jeu de données n’a été rendu public. Soutenue par une levée de fonds récente d’un milliard de dollars, World Labs poursuit sa stratégie de transformer l’IA d’un outil de traitement du langage en un système véritablement spatial. Atlas marque une étape vers cette vision, posant les bases d’une nouvelle génération d’intelligence capable de comprendre et d’interagir avec la tridimensionnalité du monde physique.

Liens associés