HyperAI
Command Palette
Search for a command to run...
ExtractBench 문서 구조화 추출 벤치마크 데이터셋
ExtractBench는 LlamaIndex가 2026년에 출시한 문서 구조화 추출 벤치마크 데이터셋으로, 사용자 정의 스키마 기반의 기업용 문서 정보 추출 시스템에 대한 표준화된 평가 기준을 제공하기 위해 설계되었습니다. 이 데이터셋은 긴 목록의 완전성 복원, 희소 사실 위치 지정, 밀집된 레이아웃 필드 채우기 등 복잡한 추출 작업 연구 및 모델 능력 평가를 지원하며, 관련 논문 결과는 ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction에서 확인할 수 있습니다.
이 데이터셋에는 실제 및 합성 문서 370개(총 4,869페이지)가 포함되어 있으며, 8개의 비즈니스 분야와 67가지 문서 유형을 아우릅니다. 각 레코드는 하나의 테스트 케이스로 구성되며, 입력값으로는 전체 문서와 사용자가 정의한 스키마(Schema), 출력값으로는 스키마 규격에 부합하는 JSON 객체가 제공됩니다. 또한 각 추출 값의 출처 페이지 번호와 경계 상자(bounding box)가 증거 자료로서 함께 제공됩니다. 이 벤치마크는 과제 난이도, 지각적 난이도, 표 구조, 문서 길이 및 비즈니스 분야의 다섯 가지 독립적인 차원을 기준으로 각 문서를 태그링하여, 낮은 점수가 구체적인 원인으로부터 비롯되었는지 쉽게 파악할 수 있도록 합니다.
데이터셋 구성:
-
분량에 따라 세 하위 집합으로 나뉩니다:
- short: 테스트 케이스 252개, 615페이지, 단일 문서 최대 10페이지 미만
- medium: 테스트 케이스 98개, 2,438페이지, 11~50페이지
- long: 테스트 케이스 20개, 1,816페이지, 50페이지 초과
-
과제 도전 과제로 분류합니다::
- T1 긴 목록 완전성: 문서 154부, 반복되는 구조물의 전량 추출 중점
- T2 긴 문서 사실 위치 지정: 문서 39부, 방대한 텍스트 내에서 특정 사실을 정확하게 찾아내는 것 중점
- T3 밀집 문서 추출: 문서 214부, 복잡한 조판, 손글씨 및 스캔 간섭 상황에서의 필드 채우기 중점
데이터 필드:
- id: 테스트 케이스 고유 식별자
- category: 데이터셋 구분(short/medium/long)
- pdf: 해당 원본 문서의 상대 경로
- data_schema: 출력이 검증되어야 하는 형식을 정의하는 JSON 인코딩 방식의 JSON Schema
- expected_output: JSON 인코딩 방식의 정답(True Value) 추출 결과
- field_rules: 비교기 타입, 증거 출처 및 검증 상태를 포함하는 JSON 인코딩 방식의 필드 레벨 평가 규칙
- repeated_structure: 배열 기록 간의 정렬을 위한 ID 키 설정
- tags: 과제 도전, 지각 조건, 표 구조, 길이 및 비즈니스 분야를 포괄하는 다차원 분석 태그
인용
@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
year={2026},
eprint={2607.29677},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2607.29677},
}
이 데이터셋은 커뮤니티 사용자가 기여한 것이며 교육 및 정보 제공 목적으로만 사용됩니다. 저작권 침해와 관련된 콘텐츠가 있는 경우 [email protected]로 문의하시면 신속하게 검토 및 삭제 처리하겠습니다.