Command Palette
Search for a command to run...
MIRACL-VISION
التاريخ
رابط الورقة البحثية
الترخيص
CC BY-SA 4.0
MIRACL-VISION هو مجموعة بيانات متعددة اللغات للاسترجاع البصري أصدرتها NVIDIA في عام 2025، والورقة البحثية المرتبطة بها هي «MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark»، وتهدف إلى تقييم خطوط أنابيب الاسترجاع متعددة اللغات ومتعددة الوسائط.
تحتوي مجموعة البيانات على 7,898 سؤالًا من المستخدمين و338,734 صورة من مقالات ويكيبيديا مع التعليقات التوضيحية المقابلة، وتدعم 18 لغة بما في ذلك العربية والبنغالية والإنجليزية والإسبانية والفارسية والفنلندية والفرنسية والهندية والإندونيسية واليابانية والكورية والروسية والسواحيلية والتيلجو والتايلاندية والصينية واليوروبا.
مكونات مجموعة البيانات
-
اللغات الفرعية: تغطي مجموعة البيانات 18 لغة، ولكل لغة تكوين (config) وملفات بيانات مستقلة.
-
الاستعلامات (Queries): تخزن نصوص استعلامات المستخدم، بتنسيق Parquet.
-
المجموعة النصية (Corpus): تخزن مقالات ويكيبيديا والبيانات المصورة المرتبطة بها، بتنسيق Parquet.
-
علاقات الاسترجاع (Qrels): تخزن معلومات الارتباط بين الاستعلامات والمستندات، بتنسيق Parquet.
-
الصور (Images): تخزن البيانات المصورة المرتبطة بالمستندات، بتنسيق Parquet.
Citation
@misc{osmulsk2025miraclvisionlargemultilingualvisual,
title={MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark},
author={Radek Osmulsk and Gabriel de Souza P. Moreira and Ronay Ak and Mengyao Xu and Benedikt Schifferer and Even Oldridge},
year={2025},
eprint={2505.11651},
archivePrefix={arXiv},
primaryClass={cs.IR},
url={https://arxiv.org/abs/2505.11651},
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.