HyperAIHyperAI

Command Palette

Search for a command to run...

MsrTextCompression: Abstractive Sentence Compression

Datum

Organisation

Microsoft Research

Lizenz

Other

MsrTextCompression ist ein von Microsoft Research im Jahr 2016 veröffentlichtes Datenset zur Bewertung von Zusammenfassungen und Komprimierungen von Sätzen und kurzen Absätzen, das darauf abzielt, einen standardisierten Korpus mit komprimierten Texten und deren Qualitätsbewertungen bereitzustellen, um die Entwicklung automatischer Zusammenfassungstechniken voranzutreiben.

Das Datenset enthält etwa 6.000 Quelltexte aus dem Open American National Corpus (OANC1) mit insgesamt etwa 26.000 Paaren von Quelltexten und komprimierten Texten, die Bereiche wie Nachrichten, Geschäftsbriefe, Zeitschriften und technische Dokumente abdecken. Jeder Quelltext verfügt über bis zu fünf von Crowdworkern erstellte Komprimierungsversionen, die mit Qualitätsbewertungen hinsichtlich Bedeutungserhalt und grammatikalischer Korrektheit versehen sind.

Zusammensetzung des Datensets

Das Datenset ist in drei Teile gegliedert:

  • Trainingsset (train): Enthält 4.936 Stichproben mit einer Datengröße von etwa 5 MB.
  • Validierungsset (validation): Enthält 447 Stichproben mit einer Datengröße von etwa 449 KB.
  • Testset (test): Enthält 785 Stichproben mit einer Datengröße von etwa 804 KB.

Jeder Datensatz enthält die folgenden Felder:

  • source_id: Der Index des Originaltexts im ursprünglichen Datenset.
  • domain: Die Domänenklassifizierung des Quelltexts (z. B. Newswire).
  • source_text: Der unkomprimierte Originaltext.
  • targets: Eine Liste mit Komprimierungsergebnissen und zugehörigen Bewertungsinformationen, wobei jedes Element einer Komprimierungsversion entspricht:
  • compressed_text: Der komprimierte Text.
  • judge_id: Die anonyme ID des Crowdworkers, der diese Komprimierungsversion bereitgestellt hat.
  • num_ratings: Die Anzahl der Bewertungen, die diese Komprimierungsversion erhalten hat.
  • ratings: Die spezifische Bewertungsliste, die auf Bedeutungserhalt und grammatikalischer Korrektheit basiert (z. B. steht 6 für höchste Bedeutung und perfekte Grammatik, 24 für geringe Bedeutung und chaotische Grammatik).

Zitation

@inproceedings{Toutanova2016ADA,
  title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs},
  author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi},
  booktitle={EMNLP},
  year={2016}
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp