Command Palette
Search for a command to run...
MMLU-CF مجموعة بيانات معيارية خالية من التلوث لفهم اللغة متعدد المهام
التاريخ
رابط الورقة البحثية
الترخيص
Other
MMLU-CF هو مجموعة بيانات معيارية متعددة الاختيارات نظيفة وأكثر تحديًا تم إصدارها بواسطة Microsoft في عام 2024، وترتبط بها ورقة بحثية بعنوان «MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark»، وتهدف إلى حل مشكلة التقييم غير الموثوق الناتجة عن تسرب بيانات التدريب في النماذج اللغوية الكبيرة في المعايير مفتوحة المصدر.
تحتوي مجموعة البيانات هذه على 20,000 سؤال اختيار من متعدد، تغطي مجالات متعددة مثل الأحياء والرياضيات والكيمياء والفيزياء والقانون والهندسة وغيرها. من خلال قواعد صارمة لإزالة التلوث وتصميم مجموعة اختبار مغلقة المصدر، يتجنب MMLU-CF بشكل فعال تأثير ذاكرة النموذج، مما يوفر معيارًا أنقى لتقييم قدرة الاستدلال الواقعي للنماذج اللغوية الكبيرة.
مكونات مجموعة البيانات
-
مجموعة التحقق (val): تحتوي على 10,000 سؤال اختيار من متعدد، مقسمة حسب التخصصات إلى مجموعات فرعية مثل Biology وMath وChemistry وPhysics وLaw وEngineering وOther وEconomics وHealth وPsychology وBusiness وPhilosophy وComputer Science وHistory.
-
مجموعة التطوير (dev): تحتوي على بيانات التطوير المقابلة، مقسمة إلى مجموعات فرعية متعددة وفقًا لنفس فئات التخصصات، وتُستخدم لتقييم النموذج والتجارب.
Citation
@misc{zhao2024mmlucfcontaminationfreemultitasklanguage,
title={MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark},
author={Qihao Zhao and Yangyu Huang and Tengchao Lv and Lei Cui and Qinzheng Sun and Shaoguang Mao and Xin Zhang and Ying Xin and Qiufeng Yin and Scarlett Li and Furu Wei},
year={2024},
eprint={2412.15194},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2412.15194},
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.