Command Palette
Search for a command to run...
Nemotron-3-Super-RL-Training-Blends مجموعة بيانات التدريب الهجين للتعلم المعزز الفائق
Nemotron-3-Super-RL-Training-Blends عبارة عن مجموعة بيانات مختلطة لتدريب التعلم المعزز أصدرتها NVIDIA في عام 2026، وتُستخدم لتدريب نموذج Nemotron-3-Super-120B-A12B، وتحتوي على 479,303 عينة بحجم إجمالي يبلغ حوالي 26.3 جيجابايت، ويتم تخزين البيانات بتنسيق JSONL، وتهدف إلى توفير بيانات مختلطة ومعالجة مسبقًا للتعلم المعزز من المكافآت القابلة للتحقق (RLVR) والتدريب اللاحق لنماذج اللغة الكبيرة.
تكوين مجموعة البيانات
-
RLVR 1: يتضمن بيانات مهام متنوعة مثل الاستدلال الرياضي، واستخدام الأدوات، ومسابقات البرمجة، واتباع التعليمات، والسلامة، بإجمالي 138,712 عينة.
-
RLVR 2: يعتمد على RLVR 1 مع تعديل نسب الخلط لمصادر البيانات المختلفة، بإجمالي 156,278 عينة.
-
RLVR 3: يعدل نسب البيانات بشكل إضافي، مع زيادة بيانات القدرات الوكيلية، واستدعاء الوظائف، والبيانات المتعلقة بالتعلم المعزز، بإجمالي 107,037 عينة.
-
SWE 1: يتكون أساسًا من R2E-Gym-Subset (79.70%) وSWE-Gym (20.30%)، بإجمالي 50,661 عينة.
-
SWE 2: يتكون أساسًا من R2E-Gym-Subset (81.18%) وSWE-Gym (18.82%)، بإجمالي 1,444 عينة.
-
RLHF: يتكون أساسًا من Nemotron-RLHF-GenRM-v1 (77.00%)، وNemotron-RL-Agentic-Conversational-Tool-Use-v1 (20.00%)، وNemotron-RL-Identity-Following-v1 (3.00%)، بإجمالي 25,171 عينة.
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.