Command Palette
Search for a command to run...
MS MARCO: Ein Von Menschen Erzeugter Datensatz Für Maschinelles Leseverständnis
Datum
Paper-URL
MS MARCO wurde von Microsoft im Jahr 2016 veröffentlicht und ist ein Datensatz, der sich auf Deep Learning im Bereich der Suche konzentriert. Die zugehörige Forschungspublikation ist „MS MARCO: A Human Generated MAchine Reading COmprehension Dataset", die darauf abzielt, durch reale Benutzeranfragen und menschlich generierte Antworten die Forschung zu Aufgaben wie Frage-Antwort, natürlicher Sprachgenerierung und Informationsabruf voranzutreiben.
Der Datensatz umfasst zwei Hauptversionen, v1.1 und v2.1, wobei v1.1 etwa 100.000 Beispiele enthält, während v2.1 auf über 1 Million Anfragen erweitert wurde. Der Datenumfang ist enorm und umfasst Trainings-, Validierungs- und Testsets, die häufig in Szenarien wie der Sprachantwortgenerierung für intelligente Lautsprecher und der Websuch-Rangfolge eingesetzt werden.
Zusammensetzung des Datensatzes
- answers: Liste von Antworten
- passages: Wörterbuchstruktur mit passage_text, is_selected und url
- query: Text der Benutzeranfrage
- query_id: ID der Anfrage
- query_type: Typ der Anfrage
- wellFormedAnswers: Liste gut formatierter Antworten
Zitation
@article{DBLP:journals/corr/NguyenRSGTMD16,
author = {Tri Nguyen and
Mir Rosenberg and
Xia Song and
Jianfeng Gao and
Saurabh Tiwary and
Rangan Majumder and
Li Deng},
title = {{MS} {MARCO:} {A} Human Generated MAchine Reading COmprehension Dataset},
journal = {CoRR},
volume = {abs/1611.09268},
year = {2016},
url = {http://arxiv.org/abs/1611.09268},
archivePrefix = {arXiv},
eprint = {1611.09268},
timestamp = {Mon, 13 Aug 2018 16:49:03 +0200},
biburl = {https://dblp.org/rec/journals/corr/NguyenRSGTMD16.bib},
bibsource = {dblp computer science bibliography, https://dblp.org}
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.