HyperAI
Command Palette
Search for a command to run...
MIRACL-VISION 多语言视觉检索数据集
MIRACL-VISION 是由 NVIDIA 于 2025 年发布的一个多语言视觉检索数据集,相关论文成果为「MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark」,旨在评估多语言、多模态检索管道。
该数据集包含 7,898 个用户问题和 338,734 张维基百科文章图片及对应标注,支持阿拉伯语、孟加拉语、英语、西班牙语、波斯语、芬兰语、法语、印地语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语、泰语、中文和约鲁巴语等 18 种语言。
数据集组成
-
语言子集:数据集涵盖 18 种语言,每种语言对应独立的配置(config)和数据文件。
-
Queries:存储用户查询文本,采用 Parquet 格式。
-
Corpus:存储维基百科文章及其对应的图像数据,采用 Parquet 格式。
-
Qrels:存储查询与文档之间的相关性信息,采用 Parquet 格式。
-
Images:存储与文档关联的图像数据,采用 Parquet 格式。
Citation
@misc{osmulsk2025miraclvisionlargemultilingualvisual,
title={MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark},
author={Radek Osmulsk and Gabriel de Souza P. Moreira and Ronay Ak and Mengyao Xu and Benedikt Schifferer and Even Oldridge},
year={2025},
eprint={2505.11651},
archivePrefix={arXiv},
primaryClass={cs.IR},
url={https://arxiv.org/abs/2505.11651},
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。