Command Palette
Search for a command to run...
سجلات تقييم مجموعة بيانات Eureka Bench Logs
التاريخ
رابط الورقة البحثية
الترخيص
Apache 2.0
Eureka Bench Logs سجلات التقييم هي مجموعة بيانات صادرة عن Microsoft في عام 2024 تحتوي على سجلات تقييم لنماذج الأساس الكبيرة، والنتيجة البحثية المرتبطة بها هي «Eureka: Evaluating and Understanding Large Foundation Models»، بهدف توفير فهم وتقييم متعمق لقدرات الاستدلال لنماذج الأساس الكبيرة في المهام المعقدة.
تتضمن مجموعة البيانات هذه سجلات التشغيل من إطار عمل Eureka ML Insights، وتوثق الأداء التفصيلي لمختلف عائلات النماذج والنماذج المحددة في مجموعة متنوعة من الاختبارات المعيارية. يتم تنظيم البيانات وفقًا للاختبارات المعيارية وعائلات النماذج وأسماء النماذج، وتغطي نتائج أبحاث توسيع وقت الاستدلال لنماذج مثل Phi-4-reasoning. تساعد هذه المعلومات الباحثين على تحليل الاختلافات في أداء النماذج في مهام مثل تحويل الصورة إلى نص واتجاهات التحسين.
مكونات مجموعة البيانات
- الاختبارات المعيارية (Benchmarks): يتم تصنيف السجلات وفقًا لمعايير التقييم المحددة، وتشمل مهام متعددة الوسائط مثل تحويل الصورة إلى نص.
- عائلات النماذج (Model Families): يتم تجميع البيانات حسب عائلة النموذج، مما يسهل مقارنة تقدم النماذج المختلفة ضمن نفس البنية.
- أسماء النماذج (Model Names): يتوافق كل إدخال سجل مع مثيل نموذج محدد، ويوثق بيانات الاستدلال والتقييم التفصيلية.
توفر هذه السجلات مادة تجريبية غنية لتقييم وفهم نماذج الأساس الكبيرة.
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.