Command Palette
Search for a command to run...
مجموعة بيانات التعلم المعزز للوكيل الطرفي Nemotron-RL-Agentic-Terminal-Pivot-v1
تم إصدار مجموعة بيانات Nemotron-RL-Agentic-Terminal-Pivot-v1 بواسطة نفيديا في عام 2026، وهي مخصصة لتدريب نماذج اللغة الكبيرة عبر التعلم التعزيزي في سيناريوهات التفاعل مع الطرفية (سطر الأوامر). صُممت هذه المجموعة خصيصًا لبيئة terminus_judge ضمن إطار عمل NeMo Gym، ويمكن استخدامها للتدريب بعد التنفيذ باستخدام التعلم التعزيزي، أو الضبط الدقيق بالإشراف، أو التحليل السلوكي غير المتزامن للوكلاء البرمجيين.
تحتوي المجموعة على 31,111 عينة تدريب مستمدة من 630 مهمة بذرية من نوع ATCB و2,716 مسار مصدر مختلف. تغطي السيناريوهات عمليات طرفية طويلة المدى في مجالات مثل الأنظمة الصناعية، ومجمعات الحوسبة عالية الأداء، والرعاية الصحية، والخدمات المالية، وأرشيف الوسائط؛ بما في ذلك مهام بناء خطوط أنابيب البيانات، وتدقيق الأعطال، وتشخيص الخدمات، وإجراءات الامتثال الأمني. يبلغ الوسيط العددي للعينات لكل مهمة 45 عينة. جميع العينات عبارة عن نقاط قرار فردية لوكيل برمجي تم استخراجها من مسارات ناجحة أكملت المهمة النهائية بنجاح، وتتضمن تعليمات المهمة، والإجراء المرجعي التالي الذي ولّده وكيل Terminus-2 المدعوم بـ GLM-5.1 كنموذج معلم، بالإضافة إلى معلومات توجيه تستخدم لتصنيف المكافآت. يتراوح متوسط طول تعليمات المهمة حوالي 39,900 حرف، بينما يصل متوسط الإجراء المرجعي التالي إلى نحو 970 حرف.
حقول البيانات:
- responses_create_params.input: النص التوجيهي، ويتضمن تعليمات المهمة وسجل التفاعلات السابقة مع الطرفية حتى نقطة القرار الحالية
- expected_answer: الإجراء التالي المرجعي للوكيل عند تلك النقطة
- agent_ref: معلومات التوجيه التي تشير إلى خادم موارد NeMo Gym الخاص ببيئة terminus_judge، وتُستخدم لتصنيف إجراءات نموذج السياسة وإنشاء مكافآت التعلم التعزيزي
- metadata: كائن بيانات وصفية يحتوي على 5 حقول فرعية، وقد تمت إزالة معرفات الجمع الداخلية ومعلومات البنية التحتية منه
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.