Command Palette
Search for a command to run...
الأوراق البحثية
أوراق بحثية متطورة في مجال الذكاء الاصطناعي يتم تحديثها يوميًا لمساعدتك على مواكبة أحدث اتجاهات الذكاء الاصطناعي
أوراق بحثية

نماذج توليد الفيديو كمتعلمين بصريين للأغراض العامة

التدريب المسبق البصري القابل للتوسع من أجل الذكاء اللغوي






























معيار المحطة الطرفية طويلة الأفق: اختبار حدود الوكلاء في مهام المحطة الطرفية طويلة الأفق مع تقييم قائم على المكافآت الكثيفة
LLM-as-a-Tutor: تكييف المطالبات المدرك للسياسة من أجل التعلم المعزز غير القابل للتحقق
الرسم البياني للمهام الذرية: إطار عمل موحد لتخطيط وتنفيذ الوكلاء
LongE2V: إعادة بناء الفيديو طويل الأفق القائم على الأحداث، والتنبؤ، والاستكمال البيني للإطارات باستخدام نماذج انتشار الفيديو
UniClawBench: معيار عالمي للوكلاء الاستباقيين في مهام العالم الحقيقي
للأفكار جينومات: تقييم منهجي لاستدلال السلالات العلمية وتوليد الأفكار القائم على السلالات
لماذا لا أستطيع فتح درجي؟ التخفيف من اختصارات التعلم المعتمدة على الكائنات في التعرف التركيبي على الأفعال بدون أمثلة مسبقة
Video-Oasis: إعادة التفكير في تقييم فهم الفيديو
Vidu S1: نموذج توليد فيديو تفاعلي في الزمن الحقيقي
قياس الفجوة بين أفكار البحث البشرية وتلك المولدة بنماذج اللغة الكبيرة
تأثير الحزام: كيف يحدد تصميم التنسيق اقتصاديات الرموز في الذكاء الاصطناعي الوكيلي للمؤسسات
عوالم لا نهائية بتفاعلات متعددة الاستخدامات
توسيع نطاق التدريب المسبق للفيديو باستخدام خليط الخبراء من أجل الذكاء المتجسد
LAME M-VLA: ذاكرة كامنة مزدوجة في نماذج الرؤية-اللغة-الفعل للتلاعب الروبوتي
فهم دقيق ومتعدد التخصصات وشفاف للعلاقة بين البنية والخاصية باستخدام الاستدلال البنيوي الأصلي العميق
التوليد التلقائي المتوازي للتسميات التوضيحية الكثيفة للفيديو متعدد الوسائط
Light-Omni: الاستجابة الانعكاسية بدلاً من الاستدلال في الفهم الفيديوي الوكيلي مع ذاكرة طويلة الأمد
الرؤية كتوليد متعدد الوسائط موحد
الاهتمام الهرمي المتناثر بالشكل الصحيح: نحو نمذجة سياق لا نهائي
عالم عاليه: توليد عوالم فيديو طويلة الأمد وقابلة للعب
RynnWorld-4D: نماذج عالمية رباعية الأبعاد مجسدة للتلاعب الروبوتي
Nemotron-Labs-3-Puzzle-75B-A9B: ضغط نماذج اللغة الهجينة القائمة على مزيج الخبراء
التقطير متعدد الدورات على السياسة مع إعادة تشغيل البادئات
تقرير تقني عن Gemma 4
UI-MOPD: التقطير متعدد المنصات القائم على السياسة للتعلم المستمر لوكلاء واجهة المستخدم الرسومية
Wan-Streamer v0.2: دقة أعلى مع الحفاظ على زمن الانتقال نفسه
EVA-Client: إطار عمل موحد للنشر والتقييم وجمع البيانات على الروبوتات الحقيقية
GigaWorld-1: خارطة طريق لبناء نماذج عالمية لتقييم سياسات الروبوتات
ResearchStudio-Idea: مجموعة مهارات لتوليد أفكار بحثية قائمة على الأدلة من مخرجات مؤتمرات تعلم الآلة
ResearchStudio-Reel: أتمتة الميل الأخير للبحث من الورقة البحثية إلى الملصق والفيديو والمدونة