HyperAIHyperAI

Command Palette

Search for a command to run...

olmOCR-bench 文書解析ベンチマークデータセット

日付

2時間前

データセット構成

Allen Institute for Artificial Intelligence

Paper URL

2502.18443

ライセンス

Other

olmOCR-benchは、AllenAIが2025年に公開したOCR文書解析ベンチマークデータセットです。このデータセットは、OCRシステムがPDF文書をMarkdown形式に変換する際の精度、および重要なテキスト情報と構造情報を完全に保持する能力を測定することを目的としています。関連する研究論文には、以下のようなものがあります。 olmOCR: ビジョン言語モデルで PDF 内の数兆個のトークンをロック解除 。 このデータセットには、1,403個のPDFファイルと7,010個のテストケースサンプルが含まれています。テストカテゴリは、arXivの数理論文、古いスキャン画像、表、ヘッダーとフッター、長文テキスト、複数列レイアウトなど、さまざまな文書形式を網羅しています。評価基準は、テキストの存在、テキストの除外検証、自然な読み順、表の正確性、数式の書式設定精度という5つの主要な指標で構成されています。

データセットの構成:

  • arXiv_math: 522個のPDFソースファイルと2,927個のテストサンプルが含まれています。
  • old_scans_math: 36個のPDFソースファイルと458個のテストサンプルが含まれています。
  • tables_tests: 188個のPDFソースファイルと1,020個のテストサンプルが含まれています。
  • old_scans: 98個のPDFソースファイルと526個のテストサンプルが含まれています。
  • headers_footers: 266個のPDFソースファイルと753個のテストサンプルが含まれています。
  • multi_column: 231個のPDFソースファイルと884個のテストサンプルが含まれています。
  • long_tiny_text: 62個のPDFソースファイルと442個のテストサンプルが含まれています。

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています