HyperAI
Command Palette
Search for a command to run...
MS MARCO: A Human Generated MAchine Reading COmprehension
MS MARCO は、Microsoft が2016年に公開した、検索分野の深層学習に特化したデータセットであり、関連する論文成果は「MS MARCO: A Human Generated MAchine Reading COmprehension Dataset」で、実ユーザーのクエリと人工生成された回答を通じて、質問応答、自然言語生成、情報検索などのタスクの研究を推進することを目的としています。
このデータセットには、v1.1 と v2.1 の2つの主要バージョンが含まれており、v1.1 には約10万のサンプルが含まれ、v2.1 は100万以上のクエリに拡張され、データ規模は非常に大きく、トレーニング、検証、テストセットを網羅し、スマートスピーカーの音声回答生成やウェブ検索ランキングなどのシナリオに広く応用されています。
データセットの構成
- answers:回答リスト
- passages:passage_text、is_selected、url を含む辞書構造
- query:ユーザークエリテキスト
- query_id:クエリID
- query_type:クエリタイプ
- wellFormedAnswers:形式の整った回答リスト
Citation
@article{DBLP:journals/corr/NguyenRSGTMD16,
author = {Tri Nguyen and
Mir Rosenberg and
Xia Song and
Jianfeng Gao and
Saurabh Tiwary and
Rangan Majumder and
Li Deng},
title = {{MS} {MARCO:} {A} Human Generated MAchine Reading COmprehension Dataset},
journal = {CoRR},
volume = {abs/1611.09268},
year = {2016},
url = {http://arxiv.org/abs/1611.09268},
archivePrefix = {arXiv},
eprint = {1611.09268},
timestamp = {Mon, 13 Aug 2018 16:49:03 +0200},
biburl = {https://dblp.org/rec/journals/corr/NguyenRSGTMD16.bib},
bibsource = {dblp computer science bibliography, https://dblp.org}
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。