HyperAI
Command Palette
Search for a command to run...
MsrTextCompression 微软文本压缩数据集
MsrTextCompression 是由 Microsoft Research 于 2016 年发布的一个用于句子和短段落摘要与压缩评估的数据集,旨在提供包含压缩文本及其质量评判的标准语料库以推动自动摘要技术的发展。
该数据集包含来自 Open American National Corpus (OANC1) 的约 6,000 个源文本,共计约 26,000 对源文本与压缩文本,涵盖新闻、商业信函、期刊和技术文档等领域。 每个源文本最多配有五个由众包人员生成的压缩版本,并附带了关于意义保留和语法正确性的质量评分。
数据集组成
该数据集分为三个部分:
- 训练集 (train):包含 4,936 个样本,数据大小约为 5 MB。
- 验证集 (validation):包含 447 个样本,数据大小约为 449 KB。
- 测试集 (test):包含 785 个样本,数据大小约为 804 KB。
每条数据记录包含以下字段:
- source_id:原文在原始数据集中的索引。
- domain:源文本的领域分类(如 Newswire)。
- source_text:未压缩的原始文本。
- targets:包含压缩结果及相关评价信息的列表,每个元素对应一个压缩版本:
- compressed_text:压缩后的文本。
- judge_id:提供该压缩版本的众包人员的匿名 ID。
- num_ratings:该压缩版本收到的评分数量。
- ratings:具体的评分列表,评分标准基于意义保留和语法正确性(例如 6 代表意义最重要且语法完美,24 代表意义极少且语法混乱)。
Citation
@inproceedings{Toutanova2016ADA,
title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs},
author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi},
booktitle={EMNLP},
year={2016}
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。