HyperAIHyperAI

Command Palette

Search for a command to run...

ExtractBench 문서 구조화 추출 벤치마크 데이터셋

날짜

조직

LlamaIndex

Paper URL

2607.29677

라이선스

Apache 2.0

ExtractBench는 LlamaIndex가 2026년에 출시한 문서 구조화 추출 벤치마크 데이터셋으로, 사용자 정의 스키마 기반의 기업용 문서 정보 추출 시스템에 대한 표준화된 평가 기준을 제공하기 위해 설계되었습니다. 이 데이터셋은 긴 목록의 완전성 복원, 희소 사실 위치 지정, 밀집된 레이아웃 필드 채우기 등 복잡한 추출 작업 연구 및 모델 능력 평가를 지원하며, 관련 논문 결과는 ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction에서 확인할 수 있습니다.

이 데이터셋에는 실제 및 합성 문서 370개(총 4,869페이지)가 포함되어 있으며, 8개의 비즈니스 분야와 67가지 문서 유형을 아우릅니다. 각 레코드는 하나의 테스트 케이스로 구성되며, 입력값으로는 전체 문서와 사용자가 정의한 스키마(Schema), 출력값으로는 스키마 규격에 부합하는 JSON 객체가 제공됩니다. 또한 각 추출 값의 출처 페이지 번호와 경계 상자(bounding box)가 증거 자료로서 함께 제공됩니다. 이 벤치마크는 과제 난이도, 지각적 난이도, 표 구조, 문서 길이 및 비즈니스 분야의 다섯 가지 독립적인 차원을 기준으로 각 문서를 태그링하여, 낮은 점수가 구체적인 원인으로부터 비롯되었는지 쉽게 파악할 수 있도록 합니다.

데이터셋 구성:

  • 분량에 따라 세 하위 집합으로 나뉩니다:

    • short: 테스트 케이스 252개, 615페이지, 단일 문서 최대 10페이지 미만
    • medium: 테스트 케이스 98개, 2,438페이지, 11~50페이지
    • long: 테스트 케이스 20개, 1,816페이지, 50페이지 초과
  • 과제 도전 과제로 분류합니다::

    • T1 긴 목록 완전성: 문서 154부, 반복되는 구조물의 전량 추출 중점
    • T2 긴 문서 사실 위치 지정: 문서 39부, 방대한 텍스트 내에서 특정 사실을 정확하게 찾아내는 것 중점
    • T3 밀집 문서 추출: 문서 214부, 복잡한 조판, 손글씨 및 스캔 간섭 상황에서의 필드 채우기 중점

데이터 필드:

  • id: 테스트 케이스 고유 식별자
  • category: 데이터셋 구분(short/medium/long)
  • pdf: 해당 원본 문서의 상대 경로
  • data_schema: 출력이 검증되어야 하는 형식을 정의하는 JSON 인코딩 방식의 JSON Schema
  • expected_output: JSON 인코딩 방식의 정답(True Value) 추출 결과
  • field_rules: 비교기 타입, 증거 출처 및 검증 상태를 포함하는 JSON 인코딩 방식의 필드 레벨 평가 규칙
  • repeated_structure: 배열 기록 간의 정렬을 위한 ID 키 설정
  • tags: 과제 도전, 지각 조건, 표 구조, 길이 및 비즈니스 분야를 포괄하는 다차원 분석 태그

인용

@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
      title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
      author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
      year={2026},
      eprint={2607.29677},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2607.29677},
}

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp