Command Palette
Search for a command to run...
MsrTextCompression: Abstractive Sentence Compression
MsrTextCompression ist ein von Microsoft Research im Jahr 2016 veröffentlichtes Datenset zur Bewertung von Zusammenfassungen und Komprimierungen von Sätzen und kurzen Absätzen, das darauf abzielt, einen standardisierten Korpus mit komprimierten Texten und deren Qualitätsbewertungen bereitzustellen, um die Entwicklung automatischer Zusammenfassungstechniken voranzutreiben.
Das Datenset enthält etwa 6.000 Quelltexte aus dem Open American National Corpus (OANC1) mit insgesamt etwa 26.000 Paaren von Quelltexten und komprimierten Texten, die Bereiche wie Nachrichten, Geschäftsbriefe, Zeitschriften und technische Dokumente abdecken. Jeder Quelltext verfügt über bis zu fünf von Crowdworkern erstellte Komprimierungsversionen, die mit Qualitätsbewertungen hinsichtlich Bedeutungserhalt und grammatikalischer Korrektheit versehen sind.
Zusammensetzung des Datensets
Das Datenset ist in drei Teile gegliedert:
- Trainingsset (train): Enthält 4.936 Stichproben mit einer Datengröße von etwa 5 MB.
- Validierungsset (validation): Enthält 447 Stichproben mit einer Datengröße von etwa 449 KB.
- Testset (test): Enthält 785 Stichproben mit einer Datengröße von etwa 804 KB.
Jeder Datensatz enthält die folgenden Felder:
- source_id: Der Index des Originaltexts im ursprünglichen Datenset.
- domain: Die Domänenklassifizierung des Quelltexts (z. B. Newswire).
- source_text: Der unkomprimierte Originaltext.
- targets: Eine Liste mit Komprimierungsergebnissen und zugehörigen Bewertungsinformationen, wobei jedes Element einer Komprimierungsversion entspricht:
- compressed_text: Der komprimierte Text.
- judge_id: Die anonyme ID des Crowdworkers, der diese Komprimierungsversion bereitgestellt hat.
- num_ratings: Die Anzahl der Bewertungen, die diese Komprimierungsversion erhalten hat.
- ratings: Die spezifische Bewertungsliste, die auf Bedeutungserhalt und grammatikalischer Korrektheit basiert (z. B. steht 6 für höchste Bedeutung und perfekte Grammatik, 24 für geringe Bedeutung und chaotische Grammatik).
Zitation
@inproceedings{Toutanova2016ADA,
title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs},
author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi},
booktitle={EMNLP},
year={2016}
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.