HyperAIHyperAI

Command Palette

Search for a command to run...

MsrTextCompression 微软文本压缩数据集

日期

数据集组织

微软研究院

许可证

Other

标签

MsrTextCompression 是由 Microsoft Research 于 2016 年发布的一个用于句子和短段落摘要与压缩评估的数据集,旨在提供包含压缩文本及其质量评判的标准语料库以推动自动摘要技术的发展。

该数据集包含来自 Open American National Corpus (OANC1) 的约 6,000 个源文本,共计约 26,000 对源文本与压缩文本,涵盖新闻、商业信函、期刊和技术文档等领域。 每个源文本最多配有五个由众包人员生成的压缩版本,并附带了关于意义保留和语法正确性的质量评分。

数据集组成

该数据集分为三个部分:

  • 训练集 (train):包含 4,936 个样本,数据大小约为 5 MB。
  • 验证集 (validation):包含 447 个样本,数据大小约为 449 KB。
  • 测试集 (test):包含 785 个样本,数据大小约为 804 KB。

每条数据记录包含以下字段:

  • source_id:原文在原始数据集中的索引。
  • domain:源文本的领域分类(如 Newswire)。
  • source_text:未压缩的原始文本。
  • targets:包含压缩结果及相关评价信息的列表,每个元素对应一个压缩版本:
  • compressed_text:压缩后的文本。
  • judge_id:提供该压缩版本的众包人员的匿名 ID。
  • num_ratings:该压缩版本收到的评分数量。
  • ratings:具体的评分列表,评分标准基于意义保留和语法正确性(例如 6 代表意义最重要且语法完美,24 代表意义极少且语法混乱)。

Citation

@inproceedings{Toutanova2016ADA,
  title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs},
  author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi},
  booktitle={EMNLP},
  year={2016}
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供