HyperAIHyperAI

Command Palette

Search for a command to run...

MIRACL-VISION هو مجموعة بيانات متعددة اللغات للاسترجاع البصري أصدرتها NVIDIA في عام 2025، والورقة البحثية المرتبطة بها هي «MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark»، وتهدف إلى تقييم خطوط أنابيب الاسترجاع متعددة اللغات ومتعددة الوسائط.

تحتوي مجموعة البيانات على 7,898 سؤالًا من المستخدمين و338,734 صورة من مقالات ويكيبيديا مع التعليقات التوضيحية المقابلة، وتدعم 18 لغة بما في ذلك العربية والبنغالية والإنجليزية والإسبانية والفارسية والفنلندية والفرنسية والهندية والإندونيسية واليابانية والكورية والروسية والسواحيلية والتيلجو والتايلاندية والصينية واليوروبا.

مكونات مجموعة البيانات

  • اللغات الفرعية: تغطي مجموعة البيانات 18 لغة، ولكل لغة تكوين (config) وملفات بيانات مستقلة.

  • الاستعلامات (Queries): تخزن نصوص استعلامات المستخدم، بتنسيق Parquet.

  • المجموعة النصية (Corpus): تخزن مقالات ويكيبيديا والبيانات المصورة المرتبطة بها، بتنسيق Parquet.

  • علاقات الاسترجاع (Qrels): تخزن معلومات الارتباط بين الاستعلامات والمستندات، بتنسيق Parquet.

  • الصور (Images): تخزن البيانات المصورة المرتبطة بالمستندات، بتنسيق Parquet.

数据集示例
数据集示例

Citation

@misc{osmulsk2025miraclvisionlargemultilingualvisual,
      title={MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark}, 
      author={Radek Osmulsk and Gabriel de Souza P. Moreira and Ronay Ak and Mengyao Xu and Benedikt Schifferer and Even Oldridge},
      year={2025},
      eprint={2505.11651},
      archivePrefix={arXiv},
      primaryClass={cs.IR},
      url={https://arxiv.org/abs/2505.11651}, 
}

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp