Command Palette
Search for a command to run...
الأوراق البحثية
أوراق بحثية متطورة في مجال الذكاء الاصطناعي يتم تحديثها يوميًا لمساعدتك على مواكبة أحدث اتجاهات الذكاء الاصطناعي
أوراق بحثية

إلى بحوث الرياضيات المستقلة

نموذج العالم الوكيل: بيئات توليدية لا نهائية للتعلم المعزز الوكيلي






























P1-VL: ج ponting بين الإدراك البصري والتفكير العلمي في مسابقات الفيزياء الأوليمبية
سلسلة العقلية: الاستدلال باستخدام أنماط معرفية متعددة التكيف
تقرير فني حول UI-Venus-1.5
Code2World: نموذج عالم واجهة رسومية مُولد عبر كود قابل للعرض
أوبوس: نحو اختيار بيانات فعّال ومقنن في تدريب النماذج اللغوية الكبيرة في كل تكرار
BagelVLA: تحسين التلاعب بفترة طويلة من خلال التوليد المتناوب للرؤية واللغة والفعل
THINGS-data: مجموعة بيانات متعددة الوسائط واسعة النطاق لاستقصاء تمثيلات الأشياء في الدماغ البشري والسلوك
تنبؤات دقيقة بالتفاعلات الجزيئية الحيوية الجديدة باستخدام IsoDDE
SKILLRL: تطوير Agents عبر Reinforcement Learning معزز بالمهارات بشكل تكراري
LLaDA2.1: تسريع التشتت النصي من خلال تعديل الرموز (Tokens)
تخفيف المكافآت النادرة من خلال نمذجة تأثيرات العينة الخطوة بخطوة والطويلة الأجل في GRPO القائمة على التدفق
Recurrent-Depth VLA: التوسع الضمني في حسابات الوقت الاختباري لنموذج الرؤية واللغة والفعل من خلال الاستدلال التكراري في الفضاء المخفي
كوانتا ألفا: إطار تطوري لاستخراج ألفا يُقوده LLM
نمط تدريب مُوجَّه بالفجوة الوظيفية لمحاذاة الفراغات الفرعية للنماذج الكبيرة للغة متعددة الوسائط
MOVA: نحو توليد فيديو صوتي قابل للتوسع والمتزامن
MemoryLLM: ذاكرة تغذية أمامية قابلة للتشغيل الفوري وقابلة للتفسير لمحولات
DreamDojo: نموذج عالم روبوت متعدد الاستخدامات مستمد من مقاطع فيديو بشرية على نطاق واسع
F-GRPO: لا تسمح لسياسة التعلم بالتعلّم من الأشياء الواضحة ونسيان النادر
MSign: مُحسِّن يمنع عدم الاستقرار التدريبي في نماذج اللغة الكبيرة من خلال استعادة الرتبة المستقرة
AudioSAE: نحو فهم نماذج معالجة الصوت باستخدام المُشفّرات التلقائية النادرة
على ديناميكية الإنتروبيا في التحسين التدريجي للنماذج اللغوية الكبيرة
أوديسيا أرينا: تقييم النماذج اللغوية الكبيرة للتفاعلات الطويلة الأجل، والنشطة، والاستنتاجية
بايتشوان-م3: نمذجة الاستفسار السريري لاتخاذ قرارات طبية موثوقة
النمذجة التوليدية عبر الانزلاق
AlphaEdit: تحرير المعرفة المُقيَّد بمجال الصفر للنماذج اللغوية
التعلم للاستنتاج في 13 معلمة
DFlash: التبادل الكتلي للتكهن بالفك الشفاف السريع
إجبار السياق: توليد فيديو تلقائي متسلسل متسق مع سياق طويل
MemSkill: تعلّم وتطور المهارات الذاكرةية للوكلاء الذاتية التطوّر
تحسين سياسة التسلسل غير المُحَيَّز طوله: كشف التغير في طول الاستجابة وتحكم فيه في التعلم بالتعزيز القائم على التقييم