HyperAI
Command Palette
Search for a command to run...
MS MARCO 微软机器阅读理解数据集
MS MARCO 是由 Microsoft 于 2016 年发布的一个专注于搜索领域深度学习的数据集,相关论文成果为「MS MARCO: A Human Generated MAchine Reading COmprehension Dataset」,旨在通过真实用户查询和人工生成的答案来推动问答、自然语言生成及信息检索等任务的研究。
该数据集包含 v1.1 和 v2.1 两个主要版本,其中 v1.1 包含约 10 万个示例,而 v2.1 扩展至超过 100 万个查询,数据规模庞大,涵盖了训练、验证和测试集,广泛应用于智能音箱语音回答生成及网页搜索排名等场景。
数据集组成
- answers:答案列表
- passages:包含 passage_text、is_selected 和 url 的字典结构
- query:用户查询文本
- query_id:查询 ID
- query_type:查询类型
- wellFormedAnswers:格式良好的答案列表
Citation
@article{DBLP:journals/corr/NguyenRSGTMD16,
author = {Tri Nguyen and
Mir Rosenberg and
Xia Song and
Jianfeng Gao and
Saurabh Tiwary and
Rangan Majumder and
Li Deng},
title = {{MS} {MARCO:} {A} Human Generated MAchine Reading COmprehension Dataset},
journal = {CoRR},
volume = {abs/1611.09268},
year = {2016},
url = {http://arxiv.org/abs/1611.09268},
archivePrefix = {arXiv},
eprint = {1611.09268},
timestamp = {Mon, 13 Aug 2018 16:49:03 +0200},
biburl = {https://dblp.org/rec/journals/corr/NguyenRSGTMD16.bib},
bibsource = {dblp computer science bibliography, https://dblp.org}
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。