HyperAIHyperAI

Command Palette

Search for a command to run...

ExtractBench 文档结构化提取基准数据集

日期

数据集组织

LlamaIndex

论文 URL

2607.29677

许可证

Apache 2.0

ExtractBench 是由 LlamaIndex 于 2026 年发布的文档结构化提取基准数据集,旨在为基于用户自定义 Schema 的企业文档信息抽取系统提供标准化评估基准,支持长列表完整性恢复、稀疏事实定位、密集版面字段填充等复杂抽取任务的研究与模型能力评测,相关论文成果为 ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

该数据集包含 370 份真实及合成文档(共 4,869 页),覆盖 8 个商业领域以及 67 种文档类型。每条记录为一个测试用例,输入为完整文档与用户定义的模式(Schema),输出为符合模式规范的 JSON 对象,并附带每个提取值的来源页码及边界框作为证据。该基准测试根据任务难度、感知难度、表格结构、文档长度和业务领域这五个独立的维度对每个文档进行标记,便于将低分归因到具体原因。

数据集构成:

  • 按篇幅分为三个子集:

    • short:252 个测试用例,615 页,单文档不超过 10 页
    • medium:98 个测试用例,2,438 页,11 至 50 页
    • long:20 个测试用例,1,816 页,超过 50 页
  • 按任务挑战划分::

    • T1 长列表完整性:154 份文档,侧重重复结构的全量提取
    • T2 长文档事实定位:39 份文档,侧重在海量文本中精准查找特定事实
    • T3 密集文档提取:214 份文档,侧重复杂排版、手写及扫描干扰下的字段填充

数据字段:

  • id:测试用例唯一标识符
  • category:数据集划分(short/medium/long)
  • pdf:对应源文档的相对路径
  • data_schema:JSON 编码的 JSON Schema,定义输出需验证的格式
  • expected_output:JSON 编码真值提取结果
  • field_rules:JSON 编码的字段级评分规则,包含比较器类型、证据来源及验证状态
  • repeated_structure:用于对齐数组记录的身份键配置
  • tags:多维分析标签,涵盖任务挑战、感知条件、表格结构、长度及业务领域

Citation

@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
      title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
      author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
      year={2026},
      eprint={2607.29677},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2607.29677},
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供