HyperAI
Command Palette
Search for a command to run...
ExtractBench 文档结构化提取基准数据集
ExtractBench 是由 LlamaIndex 于 2026 年发布的文档结构化提取基准数据集,旨在为基于用户自定义 Schema 的企业文档信息抽取系统提供标准化评估基准,支持长列表完整性恢复、稀疏事实定位、密集版面字段填充等复杂抽取任务的研究与模型能力评测,相关论文成果为 ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction。
该数据集包含 370 份真实及合成文档(共 4,869 页),覆盖 8 个商业领域以及 67 种文档类型。每条记录为一个测试用例,输入为完整文档与用户定义的模式(Schema),输出为符合模式规范的 JSON 对象,并附带每个提取值的来源页码及边界框作为证据。该基准测试根据任务难度、感知难度、表格结构、文档长度和业务领域这五个独立的维度对每个文档进行标记,便于将低分归因到具体原因。
数据集构成:
-
按篇幅分为三个子集:
- short:252 个测试用例,615 页,单文档不超过 10 页
- medium:98 个测试用例,2,438 页,11 至 50 页
- long:20 个测试用例,1,816 页,超过 50 页
-
按任务挑战划分::
- T1 长列表完整性:154 份文档,侧重重复结构的全量提取
- T2 长文档事实定位:39 份文档,侧重在海量文本中精准查找特定事实
- T3 密集文档提取:214 份文档,侧重复杂排版、手写及扫描干扰下的字段填充
数据字段:
- id:测试用例唯一标识符
- category:数据集划分(short/medium/long)
- pdf:对应源文档的相对路径
- data_schema:JSON 编码的 JSON Schema,定义输出需验证的格式
- expected_output:JSON 编码真值提取结果
- field_rules:JSON 编码的字段级评分规则,包含比较器类型、证据来源及验证状态
- repeated_structure:用于对齐数组记录的身份键配置
- tags:多维分析标签,涵盖任务挑战、感知条件、表格结构、长度及业务领域
Citation
@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
year={2026},
eprint={2607.29677},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2607.29677},
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。