Command Palette
Search for a command to run...
AceMath RewardBench
تم إصدار AceMath RewardBench بواسطة Nvidia في عام 2024، وهو مجموعة بيانات تُستخدم لتقييم قدرات نماذج المكافآت الرياضية. الورقة البحثية ذات الصلة هي «AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling»، ويهدف المشروع إلى قياس أداء نماذج مكافأة الاستدلال الرياضي بشكل شامل من خلال إعداد أفضل-of-N (حيث N = 8).
تحتوي هذه المجموعة على عينات من سبع مجموعات بيانات وهي: GSM8K (1319 سؤالاً)، وMath500 (500 سؤال)، وMinerva Math (272 سؤالاً)، وGaokao 2023 en (385 سؤالاً)، وOlympiadBench (675 سؤالاً)، وCollege Math (2818 سؤالاً)، وMMLU STEM (3018 سؤالاً).
يتضمن كل عينة وصفاً رياضياً واحداً، وستين وأربع إجابات متنوعة الجودة ناتجة عن ثمانية نماذج لغوية مختلفة تشمل Qwen2/2.5-Math وLlama3.1 وMathtral وdeepseek-math وغيرها؛ بالإضافة إلى التقييم الفعلي لكل إجابة والبيانات الوصفية مثل مستوى صعوبة السؤال ومجال الموضوع.
تركز هذه الاختبارات المعيارية على التنوع والمتانة، حيث يتم أخذ متوسط النتائج عبر مئة بذرة عشوائية للاختيار العشوائي.
تكوين البيانات
تحتوي مجموعة البيانات على الحقول التالية:
- question: النص الذي يصف المسألة الرياضية
- code: قائمة الإجابات الكاملة أو الحلول التي أنشأها النموذج
- gt: الإجابة الصحيحة الفعلية
- pred: قائمة بالنتائج المستخرجة من استجابات النماذج المختلفة
- score: قائمة القيم المنطقية تشير ما إذا كانت كل استجابة مطابقة للإجابة الحقيقية أم لا
- report: التقارير المتعلقة بذلك
- idx: فهرس العنصر
- gt_cot: سلسلة التفكير الخاصة بالإجابة الحقيقية
الاقتباس المرجعي
@article{acemath2024,
title={AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling},
author={Liu, Zihan and Chen, Yang and Shoeybi, Mohammad and Catanzaro, Bryan and Ping, Wei},
journal={arXiv preprint},
year={2024}
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.