李飛飛チーム、動画・3D復元・ロボシム統合モデル「Atlas」を発表
李飛飛氏らが設立した空間知能企業World Labsは、ゼロから学習された世界モデル「Atlas」を発表した。同モデルはテキスト、画像、動画、3Dデータを統一した三次元空間として捉え、従来のピクセル予測型生成AIとは異なり、空間理解を中核に据えた基盤技術である。 Atlasの最大の特徴は、カメラの位置と姿勢を原生入力として扱い、共有される空間文脈を構築する点にある。これにより、指定されたカメラ軌道に沿った高精度な動画生成や、複数枚の静止画からの3D再構成が可能だ。生成結果は点雲や3D Gaussian Splatting形式で出力され、従来の3D制作ワークフローやゲーム開発への直接組み込みを可能にする。 技術応用では、ロボット工学分野のReal-to-Sim(実世界から仿真へ)が注目される。Atlasはスマートフォンの動画データからシミュレーション環境を構築し、ロボットの移動軌道や機載カメラの視界をリアルタイムで生成する。高価な計測装置に頼らず、一般的な撮影でロボットの学習環境を構築する道を開いた。基盤アーキテクチャはマルチモーダル自己回帰拡散トランスフォーマーを採用し、文脈推論と視覚生成を単一モデルで統合している。 現在、Atlasは限定パートナー向けに早期テストを実施中であり、パラメータ規模や訓練データ量などの詳細は非公開だ。物理法則の正確な再現やsim-to-realギャップの解消、独立機関による検証は今後の課題とされる。しかし、生成・再構築・シミュレーションの役割を単一モデルに集約した本技術は、空間シミュレーションへ移行するAI開発の明確な方向性を示す重要なマイルストーンである。
このニュースは、業界の最新情報を効率的に提供するため、AIによって自動的に集約されています。内容は意見や助言を構成するものではありません。
