HyperAIHyperAI

Command Palette

Search for a command to run...

سجلات تقييم مجموعة بيانات Eureka Bench Logs

التاريخ

المؤسسة

Microsoft Corporation

رابط الورقة البحثية

2409.10566

الترخيص

Apache 2.0

Eureka Bench Logs سجلات التقييم هي مجموعة بيانات صادرة عن Microsoft في عام 2024 تحتوي على سجلات تقييم لنماذج الأساس الكبيرة، والنتيجة البحثية المرتبطة بها هي «Eureka: Evaluating and Understanding Large Foundation Models»، بهدف توفير فهم وتقييم متعمق لقدرات الاستدلال لنماذج الأساس الكبيرة في المهام المعقدة.

تتضمن مجموعة البيانات هذه سجلات التشغيل من إطار عمل Eureka ML Insights، وتوثق الأداء التفصيلي لمختلف عائلات النماذج والنماذج المحددة في مجموعة متنوعة من الاختبارات المعيارية. يتم تنظيم البيانات وفقًا للاختبارات المعيارية وعائلات النماذج وأسماء النماذج، وتغطي نتائج أبحاث توسيع وقت الاستدلال لنماذج مثل Phi-4-reasoning. تساعد هذه المعلومات الباحثين على تحليل الاختلافات في أداء النماذج في مهام مثل تحويل الصورة إلى نص واتجاهات التحسين.

مكونات مجموعة البيانات

  • الاختبارات المعيارية (Benchmarks): يتم تصنيف السجلات وفقًا لمعايير التقييم المحددة، وتشمل مهام متعددة الوسائط مثل تحويل الصورة إلى نص.
  • عائلات النماذج (Model Families): يتم تجميع البيانات حسب عائلة النموذج، مما يسهل مقارنة تقدم النماذج المختلفة ضمن نفس البنية.
  • أسماء النماذج (Model Names): يتوافق كل إدخال سجل مع مثيل نموذج محدد، ويوثق بيانات الاستدلال والتقييم التفصيلية.

توفر هذه السجلات مادة تجريبية غنية لتقييم وفهم نماذج الأساس الكبيرة.

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp