HyperAIHyperAI

Command Palette

Search for a command to run...

وورلد لابز تطلق أتلس العالمي للفيديو والـ3D والمحاكاة

أعلنت شركة World Labs، التي أسستها الباحثة لي فيفي مع فريق من خبراء الرؤية الحاسوبية والذكاء الاصطناعي التوليدي، عن إطلاق نموذج العالم الجديد Atlas. يُمثل هذا الإصدار، الذي يأتي عقب جولة تمويل بقيمة مليار دولار، أول نموذج عالمي متعدد الوسائط يُدرَّب من الصفر لدمج توليد الفيديو، وإعادة البناء ثلاثي الأبعاد، والمحاكاة الزمكانية ضمن بنية موحدة. يعتمد Atlas على بنية معالج Transformer انتشاري ذاتي الانعكاس متعدد الوسائط، حيث يعامل النصوص والصور ومقاطع الفيديو وبيانات العمق ومواقع الكاميرا كمدخلات متكاملة داخل سياق مكاني موحد. على عكس النماذج التقليدية التي تتنبأ بالبكسلات فحسب، يرتبط كل إطار بوضعية كاميرا دقيقة، ما يسمح للموديل بفهم البنية المجسمة للبيانات وإكمال المناطق غير المرئية بدقة عالية. تتيح هذه الآلية التحكم الدقيق بمسارات التصوير، وإنتاج مقاطع فيديو بدقة 1440p لمدة دقيقة كاملة، بالإضافة إلى تحويل صور نادرة إلى سحابات نقطية ومشاهد Gaussian Splatting جاهزة للتطبيق المباشر في سير عمل الألعاب والسينما. يمتد أثر النموذج ليشمل قطاع الروبوتات، حيث يوفر حلاً مبتكراً لمحاكاة الواقع إلى المحاكاة. باستخدام عدسات هاتف فقط، يستطيع Atlas إعادة بناء البيئات الديناميكية وتوليد رؤيات كاميرا وبيانات عمق متزامنة مع حركة الروبوت الافتراضي، مما يسهل تدريب أنظمة الذكاء الاصطناعي الحركي دون الحاجة لمعدات مسح معقدة. يأتي إطلاق Atlas في خضم سباق متسارع لتطوير نماذج العالم، مواكباً مبادرات مماثلة من مختبرات كبرى. وعلى الرغم من أن النموذج لا يزال قيد الاختبار المبكر مع شركاء محددين، فإن النتائج الأولية تبرز انتقالاً جوهرياً في مجال النماذج التوليدية من مجرد إنتاج المشاهد البصرية إلى فهم العلاقات المكانية والفيزيائية. وتظل هناك حاجة لمزيد من التقييم المستقل لموثوقية المحاكاة الفيزيائية الدقيقة، لكن الإطار التقني لـ Atlas يرسم خريطة طريق واضحة نحو دمج أدوات التوليد والمحاكاة والتخطيط في نظام عالمي موحد يدعم الجيل القادم من الروبوتات والواقع الافتراضي.

الروابط ذات الصلة