HyperAI
Command Palette
Search for a command to run...
MsrTextCompression: 抽象的文圧縮(Abstractive Sentence Compression)
MsrTextCompression は、Microsoft Research が2016年に公開した、文および短い段落の要約と圧縮の評価のためのデータセットであり、圧縮テキストとその品質評価を含む標準コーパスを提供し、自動要約技術の発展を促進することを目的としています。
このデータセットには、Open American National Corpus (OANC1) からの約6,000のソーステキストが含まれ、合計で約26,000組のソーステキストと圧縮テキストが収録されており、ニュース、ビジネスレター、ジャーナル、技術文書などの分野をカバーしています。 各ソーステキストには、最大5つのクラウドソーシングによる圧縮バージョンが付属し、意味の保持と文法の正確性に関する品質スコアが添付されています。
データセット構成
このデータセットは3つの部分に分かれています:
- トレーニングセット (train):4,936サンプルを含み、データサイズは約5 MBです。
- 検証セット (validation):447サンプルを含み、データサイズは約449 KBです。
- テストセット (test):785サンプルを含み、データサイズは約804 KBです。
各データレコードには以下のフィールドが含まれます:
- source_id:元のデータセットにおける原文のインデックス。
- domain:ソーステキストの分野分類(例:Newswire)。
- source_text:圧縮されていない原文テキスト。
- targets:圧縮結果と関連する評価情報を含むリストで、各要素が1つの圧縮バージョンに対応します:
- compressed_text:圧縮後のテキスト。
- judge_id:その圧縮バージョンを提供したクラウドソーシング作業者の匿名ID。
- num_ratings:その圧縮バージョンが受け取った評価の数。
- ratings:具体的な評価リスト。評価基準は意味の保持と文法の正確性に基づきます(例:6は意味が最も重要で文法が完璧、24は意味がほとんどなく文法が混乱していることを示します)。
Citation
@inproceedings{Toutanova2016ADA,
title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs},
author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi},
booktitle={EMNLP},
year={2016}
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。