Command Palette
Search for a command to run...
HelpSteer2 مجموعة بيانات محاذاة التفضيلات البشرية
التاريخ
الحجم
رابط الورقة البحثية
الترخيص
CC BY 4.0
* هذه المجموعة من البيانات تدعم الاستخدام عبر الإنترنت.انقر هنا للقفز.
HelpSteer2 هي مجموعة بيانات مفتوحة المصدر تم إنشاؤها بشكل مشترك بين NVIDIA وScale AI في عام 2024. وتهدف إلى تدريب نموذج مكافأة يمكنه توجيه نماذج اللغة الكبيرة (LLMs) لتوليد إجابات عالية الجودة تلبي التفضيلات البشرية. "نتائج الورقة ذات الصلة هي"HelpSteer2: مجموعة بيانات مفتوحة المصدر لتدريب نماذج المكافآت ذات الأداء الأفضلتم تحديثه بناءً على مجموعة بيانات HelpSteer للتكيف مع نماذج LLMs الحالية الأكثر قوة. يحتوي HelpSteer2 على حوالي عشرة آلاف زوج من الإجابات، وهو أصغر بكثير من مجموعات بيانات التفضيلات الحالية، ولكنه فعال للغاية في تدريب نماذج المكافآت. تم جمع مجموعة البيانات من خلال أخذ المطالبات من منصة ShareGPT وتوليد الاستجابات باستخدام نموذج أساسي قوي داخليًا. تتطلب عملية التعليق على الإجابات ثلاثة معلقين على الأقل لتعليق كل إجابة لتحسين جودة التعليق. تظهر الإحصائيات من HelpSteer2 أن إجابات النموذج تحصل على درجات أعلى من حيث المساعدة والصحة والترابط والتعقيد والإسهاب مقارنة بمجموعة بيانات HelpSteer. تُعد مجموعة بيانات HelpSteer2 فعالة جدًا في تدريب نماذج المكافآت. على سبيل المثال، حقق نموذج Llama 3 70B المدرب باستخدام HelpSteer2 درجة 92.0% على مجموعة بيانات Reward-Bench الرئيسية، متفوقًا على جميع النماذج العامة والخاصة المدرجة اعتبارًا من 12 يونيو 2024. بالإضافة إلى ذلك، اقترح فريق البحث أيضًا طريقة محاذاة نموذج SteerLM 2.0، والتي يمكنها الاستفادة بشكل فعال من الدرجات المتعددة السمات الغنية التي يتنبأ بها نموذج المكافأة.
الاستشهاد
@misc{wang2024helpsteer2preferencecomplementingratingspreferences,
title={HelpSteer2-Preference: Complementing Ratings with Preferences},
author={Zhilin Wang and Alexander Bukharin and Olivier Delalleau and Daniel Egert and Gerald Shen and Jiaqi Zeng and Oleksii Kuchaiev and Yi Dong},
year={2024},
eprint={2410.01257},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2410.01257},
}
@misc{wang2024helpsteer2,
title={HelpSteer2: Open-source dataset for training top-performing reward models},
author={Zhilin Wang and Yi Dong and Olivier Delalleau and Jiaqi Zeng and Gerald Shen and Daniel Egert and Jimmy J. Zhang and Makesh Narsimhan Sreedhar and Oleksii Kuchaiev},
year={2024},
eprint={2406.08673},
archivePrefix={arXiv},
primaryClass={id='cs.CL' full_name='Computation and Language' is_active=True alt_name='cmp-lg' in_archive='cs' is_general=False description='Covers natural language processing. Roughly includes material in ACM Subject Class I.2.7. Note that work on artificial languages (programming languages, logics, formal systems) that does not explicitly address natural-language issues broadly construed (natural-language processing, computational linguistics, speech, text retrieval, etc.) is not appropriate for this area.'}
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.