HyperAIHyperAI

Command Palette

Search for a command to run...

MsrTextCompression: 抽象的文圧縮(Abstractive Sentence Compression)

日付

データセット構成

Microsoft Research

ライセンス

Other

MsrTextCompression は、Microsoft Research が2016年に公開した、文および短い段落の要約と圧縮の評価のためのデータセットであり、圧縮テキストとその品質評価を含む標準コーパスを提供し、自動要約技術の発展を促進することを目的としています。

このデータセットには、Open American National Corpus (OANC1) からの約6,000のソーステキストが含まれ、合計で約26,000組のソーステキストと圧縮テキストが収録されており、ニュース、ビジネスレター、ジャーナル、技術文書などの分野をカバーしています。 各ソーステキストには、最大5つのクラウドソーシングによる圧縮バージョンが付属し、意味の保持と文法の正確性に関する品質スコアが添付されています。

データセット構成

このデータセットは3つの部分に分かれています:

  • トレーニングセット (train):4,936サンプルを含み、データサイズは約5 MBです。
  • 検証セット (validation):447サンプルを含み、データサイズは約449 KBです。
  • テストセット (test):785サンプルを含み、データサイズは約804 KBです。

各データレコードには以下のフィールドが含まれます:

  • source_id:元のデータセットにおける原文のインデックス。
  • domain:ソーステキストの分野分類(例:Newswire)。
  • source_text:圧縮されていない原文テキスト。
  • targets:圧縮結果と関連する評価情報を含むリストで、各要素が1つの圧縮バージョンに対応します:
  • compressed_text:圧縮後のテキスト。
  • judge_id:その圧縮バージョンを提供したクラウドソーシング作業者の匿名ID。
  • num_ratings:その圧縮バージョンが受け取った評価の数。
  • ratings:具体的な評価リスト。評価基準は意味の保持と文法の正確性に基づきます(例:6は意味が最も重要で文法が完璧、24は意味がほとんどなく文法が混乱していることを示します)。

Citation

@inproceedings{Toutanova2016ADA,
  title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs},
  author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi},
  booktitle={EMNLP},
  year={2016}
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています