Command Palette
Search for a command to run...
مجموعة بيانات بيرسبشن بنش المعيارية للإدراك البصري
يُعدّ PerceptionBench مجموعة بيانات مرجعية لقياس قدرات الإدراك البصري للنماذج الكبيرة، وقد أصدرتها شركة Moonshot AI عام 2026. صُممت هذه المجموعة خصيصًا لتقييم قدرات الإدراك البصري الأساسية لنماذج اللغة الكبيرة متعددة الوسائط (MLLMs). تتضمن الأبحاث ذات الصلة ما يلي... منصة الإدراك: تقييم الإدراك البصري الذري في نماذج اللغة الكبيرة متعددة الوسائط . تحتوي هذه المجموعة من البيانات على 3000 سؤال اختبار مُدقَّق تغطي 10 قدرات إدراكية أساسية، تشمل فهم العلاقات البصرية، والعد، والتعرف على السمات، وإدراك العمق والأبعاد الثلاثية، والتحديد المكاني، والاستدلال المقارن، والتعرف الدقيق، ودمج السياق، وفهم النصوص بتقنية التعرف الضوئي على الحروف (OCR)، والهلوسات المتعلقة بالإدراك. من بين هذه الأسئلة، 1800 سؤال عبارة عن مسائل فرعية دقيقة مستمدة من عينات فاشلة من معايير مرجعية موجودة، و1200 سؤال تم إنشاؤها حديثًا بناءً على صور إضافية. يستخدم التقييم قوالب كلمات توجيهية موحدة وأعلى ميزانية استدلال متاحة لإجراء اختبارات الإجابة على الأسئلة المفتوحة على 16 نموذجًا لغويًا متعدد الوسائط متطورًا، بما في ذلك GPT-5.6-Sol وKimi K3 وClaude-Fable-5.
حقول البيانات:
- الرقم المرجعي: رقم مرجعي فريد للعينة
- الإجابة: إجابة مرجعية
- المشكلة: وصف المشكلة
- تلميح: رسالة تنبيه
- صورة: معلومات الصورة في السؤال
- error_category: فئة قدرة الاستشعار الذري المقابلة للعينة.
- source_bmk: مُعرِّف المصدر للمعيار المرجعي الأولي
- source_idx: الفهرس الأصلي للعينة في المعيار المرجعي الأولي.
الاستشهاد
@article{perceptionbench2026,
title = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author = {Moonshot AI},
year = {2026}
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.