Command Palette
Search for a command to run...
Nemotron-3-Nano-RL-Training-Blend مجموعة بيانات تدريب التعلم المعزز
Nemotron-3-Nano-RL-Training-Blend هو مجموعة بيانات منتقاة أصدرتها NVIDIA في عام 2025 لتدريب نموذج Nemotron-3-Nano-30B-A3B، وتحتوي على 93,244 عينة بحجم تخزين إجمالي يبلغ 6.92 جيجابايت، مع حجم بيانات معتدل تمت معالجته ومزجه بعناية. يتكون من عدة مجموعات بيانات فرعية ممزوجة بنسب محددة، بما في ذلك مهام مثل اتباع التعليمات، والإجابة على الأسئلة المعرفية، ومساعد مكان العمل، والمخرجات المنظمة، والبرمجة التنافسية، والاستدلال الرياضي. يهدف إلى تحسين أداء نماذج اللغة الكبيرة من خلال إطار التعلم المعزز من المكافآت القابلة للتحقق (RLVR).
يتم ترتيب عينات البيانات بترتيب تعليمي تصاعدي من السهل إلى الصعب لضمان تقدم تعليمي متوازن، وهي مصممة خصيصًا لمرحلة ما بعد التدريب في إطار NeMo Gym، وتدعم الاستخدام التجاري.
تكوين مجموعة البيانات
هذه المجموعة هي مجموعة بيانات هجينة تتكون من مجموعات البيانات الفرعية التالية ممزوجة بالنسب المحددة:
- nvidia/Nemotron-RL-instruction_following (0.17)
- nvidia/Nemotron-RL-knowledge-mcqa (0.20)
- nvidia/Nemotron-RL-agent-workplace_assistant (0.10)
- nvidia/Nemotron-RL-instruction_following-structured_outputs (0.05)
- nvidia/Nemotron-RL-coding-competitive_coding (0.25)
- BytedTsinghua-SIA/DAPO-Math-17k (0.10)
- Skywork/Skywork-OR1-RL-Data (باستثناء OmniMath) (0.12)
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.