HyperAIHyperAI

Command Palette

Search for a command to run...

4 小时前
文档理解
LLM

ExtractBench:面向模式引导的企业文档抽取基准

Boyang Zhang Adrian Lyjak Eli Stewart Zhaoqi Li Simon Suo

摘要

企业工作流日益依赖智能体进行模式引导的抽取:给定文档和用户定义的模式,智能体忠实遵循该模式,生成正确输出并以来源证据作为 grounding 元数据。我们提出 ExtractBench,一个面向模式引导抽取的基准,并据我们所知,首次同时报告了值准确率、规模化记录完整性、grounding 以及实测成本的评估结果。该基准包含 370 份企业文档中的 4,869 页内容,覆盖 8 个业务领域和 67 种文档类型,并通过明确标签区分其挑战场景。可扩展的模式与真值构建流程结合了独立系统一致性判定与人工裁定(用于真实文档)、合成列表的已知值,以及表单的人工验证。我们采用顺序无关的值 F1 衡量值准确率,并引入两个用于来源可追溯性的 grounding 指标:词级和页级 F1。商用 VLM 在短文档上表现良好,但在长文档上常常截断记录列表,而编码智能体以高得多的成本保持更高准确率。LlamaExtract Agentic Plus 在三项指标上均排名第一,准确率高于编码智能体,成本为 8.1 美分/页,而后者为 16.2–27.8 美分/页。数据集和评估代码已在 HuggingFace 和 GitHub 上公开。

一句话总结

ExtractBench 是一个以模式为导向的企业文档抽取基准,覆盖 4,869 页、370 份企业文档、8 个业务领域和 67 种文档类型,其构建流程结合了独立系统一致性、裁定、已知合成值和人工验证;该基准报告顺序无关的值 F1、记录完整性、词级和页级定位 F1,以及实测成本,其中 LlamaExtract Agentic Plus 在所有三个 F1 指标上排名第一,成本为 8.1 美分/页,而编程类 Agent 为 16.2 至 27.8 美分/页。

核心贡献

  • ExtractBench 被提出为一个带挑战标签的模式导向抽取基准,包含 4,869 页、370 份企业文档、8 个业务领域和 67 种文档类型,其中标签用于区分任务难度和感知难度。
  • 一个可扩展的模式和真值构建流程结合了针对真实文档的独立系统一致性与裁定、针对合成长列表的已知值,以及针对表单的人工验证。
  • 评估共同衡量通过顺序无关的值 F1 反映的值准确性、大规模记录完整性、通过词级和页级 F1 反映的定位能力,以及成本;LlamaExtract Agentic Plus 在所有三个指标上排名第一,成本为每页 8.1 美分,而编程类 Agent 为每页 16.2 至 27.8 美分,定位能力仍然是最明确的改进方向。

引言

从发票、理赔单和监管申报文件等业务文档中抽取结构化数据是一种高容量、重复性的工作流,其中错误可能代价高昂,企业越来越希望基于 LLM 的 Agent 能够大规模处理模式导向抽取。此前的基准通常预先固定抽取本体,或只覆盖较窄的维度,例如模式复杂度、长列表完整性或长报告,而未能共同衡量定位能力、成本、扫描或手写输入以及视觉可追溯性。作者提出 ExtractBench,这是一个带挑战标签的基准,包含 370 份文档和 4,869 页,覆盖 8 个业务领域和 67 种文档类型,旨在评估正确且完整的 JSON 抽取、来源定位、在不同文档挑战下的稳健性以及每页成本。作者还贡献了一个可扩展的模式和真值构建流程,并评估了 14 种方法,涵盖商业视觉语言模型、编程类 Agent、开源系统和专用抽取 API。

数据集

ExtractBench 是一个基于真实文档、合成长列表和扫描表单构建的模式导向抽取基准。每个文档都沿五个独立轴打标签,以便将错误追溯到任务难度、采集质量、表格结构、长度或领域。

  • 任务定义:

    • 输入是一份完整文档,可以是原生数字文档或扫描件,外加一个 JSON Schema。
    • Schema 定义字段、类型、自然语言描述、嵌套对象、数组、可空性和取值约束。
    • 输出是符合 Schema 的 JSON,并为每个值提供来源页面和边界框证据。
    • 缺失的文档信息必须返回为 null。
  • 数据集构成与规模:

    • 覆盖 8 个业务领域和 67 种文档类型:
      • D1:金融与基金持仓
      • D2:能源行业监管表单
      • D3:政府采购与海关
      • D4:汽车估值
      • D5:供应链与交易文档
      • D6:医疗支付
      • D7:法律与破产申报
      • D8:房地产交割披露
    • 长度区间:
      • L1:不超过 10 页
      • L2:11 至 50 页
      • L3:超过 50 页
    • 感知标签:
      • P1:旋转或仅图像采集
      • P2:扫描页图像
      • P3:手写
    • 表格结构标签:
      • S1:合并或分层表头
      • S2:表头不在其数据上方
      • S3:表格跨页延续
      • S4:超过 1,000 行的表格
      • S5:表格被塞进单个单元格
    • 任务挑战标签:
      • T1:长列表完整性
      • T2:大海捞针,每页请求字段中位数为 1.6
      • T3:密集文档
      • T3.a:最常见的密集表单情形
      • T3.e:超过 150 个叶子字段的 Schema
  • 来源与筛选规则:

    • 真实文档:
      • Schema 根据样本文档起草。
      • 来自不同模型和流程家族的多个抽取系统在候选 Schema 上运行。
      • 只有当所有系统一致时,一个值才成为候选真值,包括缺失字段的 null 一致。
      • 分歧按原因分类:
        • 如果存在不止一种合理解读,则认为 Schema 有歧义,并通过别名、格式要求、位置提示和防混淆指南收紧,直到重新运行结果收敛。
        • 如果只有一种合理解读,则将其视为模型失败,由审核员对照页面裁定有争议的单元格。
    • 合成长列表:
      • 采用数据优先的方式,基于基金明细、持仓登记或债权人矩阵等真实申报文件构建。
      • 记录被逐字解析,或以相同风格生成。
      • 渲染代码生成与原始布局匹配的 PDF,分页位置通过测量确定。
      • 真值在构造上就是精确的,因为每个值、页面和词级框都来自渲染过程,因而已知。
      • 机械检查会捕获风格不匹配和裁剪问题。
      • 一个抽取系统池会审核最终文档,发现渲染缺陷。
    • 扫描表单:
      • Schema 针对空白表单模板编写,并在标注前冻结。
      • 最多五个系统组成的集成在每个 Schema 叶字段上投票。
      • 有争议的投票交给一个裁定 Agent,该 Agent 必须检查页面。
      • 人工标注员接受、编辑、置空或重新绘制每个建议框。
      • 由此产生 169 份人工验证文档。
      • 84% 的已验证字段带有人工放置的框;其余主要是空白字段。
    • 降质扫描:
      • 通过重新采集干净文档生成。
      • 无需新增标注,因为干净文档的真值可以直接沿用。
  • 元数据与真值构建:

    • 真实文档的值通过跨独立系统的一致性确认。
    • 合成值和边界框在构造上就是精确的。
    • 扫描表单的值和边界框由人工检查。
    • 所有文档都会对值进行评分。
    • 框级定位只对已验证边界框的文档评分。
  • 论文中的使用:

    • 所提供的摘录将 ExtractBench 描述为用于模式导向抽取的评估基准。
    • 其中没有说明训练划分或混合比例。
    • 论文强调通过独立的任务、感知、表格、长度和领域轴进行评估与错误归因。

方法

要正确评估模式导向抽取系统,抽取任务必须被明确指定,这要求 Schema 一致且每个字段都有清晰的期望值。手动创建这些 Schema 和对应真值极为耗费人力且成本高昂,对于长文档和密集文档尤其如此。依赖单一抽取器输出会引入偏差并重复其错误。为解决这一问题,作者设计了一个可扩展流程,无需完全手动标注即可生成高质量的 Schema 与真值对。该方法结合了三种不同的文档来源,每种都采用最适合其特征的标注方法:真实文档使用前沿模型集成,合成长列表使用程序化生成,扫描表单使用人工标注员。

构建这三类来源真值的总体框架如下图所示。

对于真实文档,作者利用多阶段流程建立真值。一个 Schema 发现 Agent 首先根据示例 PDF 起草 Schema,包括别名和防混淆指南。随后,该候选 Schema 由一个包含多种前沿模型和编程类 Agent 的多样化模型池评估。所有系统一致的值成为候选真值。分歧会被诊断以确定原因。如果多种解读都合理,则收紧 Schema 描述,直到重新运行收敛。如果只有一种解读合理,则将其视为模型失败,由人工审核员对照页面裁定有争议的单元格。最终真值包含值和页码,但不包含词级框。

对于合成长列表,作者采用程序化生成方法,完全避免人工标注。该过程从数据反向构建文档。首先,从真实申报文件中逐字解析记录。同时,一个编程类 Agent 研究布局字体、列和页面边缘元素,以生成样式代码。该代码将记录渲染成与原始文档高度匹配的 PDF。由于每个值在 PDF 生成前就已经已知,并且页面和词级框可以从渲染结果中回读,因此无论列表多长,真值都保持精确。机械检查确保样式匹配并防止裁剪,而模型池审核会暴露任何渲染代码缺陷,这些缺陷会在文档族最终确定前修复。该流程产出的真值包含值、词框和页码,其可信度来自构造过程和模型池审核。

对于扫描表单,由于字迹不清和标记模糊,人工验证必不可少。Schema 针对空白表单模板编写,并在标注前冻结。最多五个系统组成的集成在每个 Schema 叶字段上投票,裁定 Agent 检查有争议的投票。一个指定流程为每个字段提出一个框,随后由人工标注员接受、编辑、置空或重新绘制。这一严格流程产生人工验证文档,其真值包含值、词框和页码,可信度来自模型投票和人工验证。

这三条流程对其真值的支持方式不同。真实文档的值通过跨独立系统的一致性确认,合成值和边界框在构造上就是精确的,而表单值和边界框由人工检查。这决定了每个文档支持哪些指标,即所有文档都会对值进行评分,而框级定位仅应用于已验证边界框的文档。

实验

实验评估了十四种抽取系统,涵盖视觉语言模型、编程类 Agent 和专用 API,使用值准确率和来源定位指标。质量-成本分析显示,专用 API,尤其是 LlamaExtract 各层级,覆盖了最佳权衡前沿,编程类 Agent 以高得多的成本实现高准确率,而商业 VLM 保持低成本但低于更强的准确率。按文档长度、任务类型、感知挑战、表格结构和业务领域细分的结果显示,长文档、密集 Schema、扫描页面和超大表格会导致召回失败和系统特有的薄弱点。定位能力仍然是一个明显差距,因为大多数系统默认不提供证据,即使是最强的系统也难以将值连接到精确的词级来源。

固定本体基准覆盖真实文档,但使用固定 Schema,并且只部分覆盖长记录、扫描或手写内容。模式导向基准各有侧重,一些关注 Schema 复杂度,另一些关注长记录完整性,但都没有共同评估定位能力和成本。ExtractBench 的独特之处在于同时结合了长记录完整性、真实扫描和手写内容、页级和词级定位以及实测成本。固定本体基准使用固定 Schema,通常只部分覆盖长记录以及扫描或手写内容。模式导向基准要么评估一小组共享 Schema,要么评估逐文档 Schema,限制了对不同文档间 Schema 迁移的覆盖。ExtractBench 是唯一共同评估长记录完整性、真实扫描和手写内容、词级和页级定位以及实测成本的基准。

各系统差异最大的地方是长文档和结构复杂输入,例如超大表格。最强系统在不同文档长度和感知挑战下仍保持在 90 F1 以上,而许多其他系统出现急剧下降,尤其是商业 VLM 在长文档上以及若干系统在超大表格上。一些感知失败是系统特有的,而非普遍性问题。长文档导致性能差距扩大,商业 VLM 远低于其短文档得分,而少数系统仍接近其短文档表现。超大表格造成最明显的分化,若干系统只返回一小部分记录,而顶级系统保持高准确率。感知挑战暴露出因系统而异的盲点,例如在扫描页面或旋转仅图像输入上的相对薄弱。

定位性能按粒度明显分化:对报告中的抽取系统而言,页级定位远强于词级定位。长文档通常降低页级定位,部分系统降至零,而少数系统保持更稳定。即使最强的词级定位仍低于一半,表明精确证据定位仍然是一个未解决的挑战。在每个所列系统中,页级定位始终高于词级定位。LlamaExtract Agentic Plus 在两个定位级别上总体上领先,但其词级 F1 远低于页级 F1。Datalab 和 Extend Max Context 在长文档上均降至零页级定位,而 Reducto Deep Extract 保持相对稳定。默认不返回证据的系统在两个定位级别上均为零。最佳整体词级定位 F1 仅为 46.4%。

ExtractBench 被定位为同时结合长记录完整性、真实扫描和手写内容、页级和词级定位以及实测成本的基准,不同于仅提供部分覆盖的固定本体或模式导向替代方案。各系统之间的性能差异在长文档和超大表格上最为明显,若干商业视觉语言模型和抽取系统急剧下降,而最强系统保持相对稳定。定位结果表明,页级证据定位始终远强于词级定位,而且长文档通常导致部分系统页级定位失败。即使最好的词级定位也仍然很低,表明精确证据定位仍是一个未解决的挑战。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供