HyperAIHyperAI

Command Palette

Search for a command to run...

MIRACL-VISION 多语言视觉检索数据集

日期

数据集组织

英伟达

论文 URL

2505.11651

许可证

CC BY-SA 4.0

MIRACL-VISION 是由 NVIDIA 于 2025 年发布的一个多语言视觉检索数据集,相关论文成果为「MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark」,旨在评估多语言、多模态检索管道。

该数据集包含 7,898 个用户问题和 338,734 张维基百科文章图片及对应标注,支持阿拉伯语、孟加拉语、英语、西班牙语、波斯语、芬兰语、法语、印地语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语、泰语、中文和约鲁巴语等 18 种语言。

数据集组成

  • 语言子集:数据集涵盖 18 种语言,每种语言对应独立的配置(config)和数据文件。

  • Queries:存储用户查询文本,采用 Parquet 格式。

  • Corpus:存储维基百科文章及其对应的图像数据,采用 Parquet 格式。

  • Qrels:存储查询与文档之间的相关性信息,采用 Parquet 格式。

  • Images:存储与文档关联的图像数据,采用 Parquet 格式。

数据集示例
数据集示例

Citation

@misc{osmulsk2025miraclvisionlargemultilingualvisual,
      title={MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark}, 
      author={Radek Osmulsk and Gabriel de Souza P. Moreira and Ronay Ak and Mengyao Xu and Benedikt Schifferer and Even Oldridge},
      year={2025},
      eprint={2505.11651},
      archivePrefix={arXiv},
      primaryClass={cs.IR},
      url={https://arxiv.org/abs/2505.11651}, 
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供