HyperAIHyperAI

Command Palette

Search for a command to run...

معيار فهم الصور ومجموعة بيانات معيارية لفهم الصور

التاريخ

المؤسسة

Microsoft Corporation

الترخيص

cdla-permissive-2.0

معيار فهم الصور هو مجموعة بيانات اصطناعية صادرة عن Microsoft في عام 2024 لتقييم فهم الصور، ويهدف إلى تقييم قدرات النماذج متعددة الوسائط في فهم الصور والاستدلال المكاني والتنبيه البصري والتعرف على الأشياء واكتشافها.

تحتوي مجموعة البيانات على أربع مهام فرعية: اكتشاف الأشياء، والتعرف على الأشياء، والاستدلال المكاني، والتنبيه البصري، مع توليد حوالي 10,240 صورة. يتم توليد البيانات برمجيًا، مع دمج كائنات COCO وخلفيات Places365، وإضافة تغييرات عشوائية في التدوير والموضع والقياس، ويمكن استخدامها لتقييم القدرة البصرية للنماذج متعددة الوسائط.

تكوين مجموعة البيانات

تحتوي مجموعة البيانات على 8 تكوينات (config)، مقسمة إلى شرطين: كائن واحد (single) وكائنين (pairs)، وتغطي المهام الفرعية الأربع التالية:

  • اكتشاف الأشياء (Object Detection)
  • التعرف على الأشياء (Object Recognition)
  • الاستدلال المكاني (Spatial Reasoning)
  • التنبيه البصري (Visual Prompting)

تولد كل مهمة فرعية 1,280 صورة تحت كل شرط، بإجمالي حوالي 10,240 صورة. يحتوي كل تكوين بشكل أساسي على الحقول التالية:

  • id: الرقم الفريد لعينة البيانات.
  • image: الصورة المدخلة.
  • prompt: نص التنبيه المستخدم لتقييم النموذج.
  • ground_truth: الإجابة القياسية في بعض المهام.
数据集示例
数据集示例

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp