HyperAIHyperAI

Command Palette

Search for a command to run...

olmOCR-bench 文档解析基准数据集

날짜

조직

Allen Institute for Artificial Intelligence

Paper URL

2502.18443

라이선스

Other

태그

olmOCR-bench는 AllenAI에서 2025년에 공개한 OCR 문서 파싱 벤치마크 데이터셋입니다. 이 데이터셋은 OCR 시스템이 PDF 문서를 마크다운 형식으로 변환하는 정확도와 핵심 텍스트 및 구조적 정보를 완벽하게 보존하는 능력을 측정하는 것을 목표로 합니다. 관련 연구 논문으로는 다음과 같은 것들이 있습니다... olmOCR: 비전 언어 모델을 사용하여 PDF에서 수조 개의 토큰 잠금 해제 . 이 데이터 세트는 1,403개의 PDF 파일과 7,010개의 테스트 케이스 샘플로 구성되어 있습니다. 테스트 범주는 arXiv에 게시된 수학 논문, 오래된 스캔 파일, 표, 머리글 및 바닥글, 긴 텍스트, 다단 레이아웃 등 다양한 문서 형식을 포함합니다. 평가 기준은 텍스트 존재 여부, 텍스트 제외 검증, 자연스러운 읽기 순서, 표 정확도, 수학 공식 서식 정확도의 다섯 가지 핵심 지표를 사용합니다.

데이터셋 구성:

  • arXiv_math: 522개의 PDF 원본 파일과 2,927개의 테스트 샘플을 포함합니다.
  • old_scans_math: 36개의 PDF 원본 파일과 458개의 테스트 샘플을 포함합니다.
  • tables_tests: 188개의 PDF 원본 파일과 1,020개의 테스트 샘플을 포함합니다.
  • old_scans: 98개의 PDF 원본 파일과 526개의 테스트 샘플을 포함합니다.
  • headers_footers: 266개의 PDF 원본 파일과 753개의 테스트 샘플을 포함합니다.
  • multi_column: 231개의 PDF 원본 파일과 884개의 테스트 샘플을 포함합니다.
  • 긴 텍스트: 62개의 PDF 원본 파일과 442개의 테스트 샘플을 포함합니다.

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp