Command Palette
Search for a command to run...
olmOCR-bench 文書解析ベンチマークデータセット
olmOCR-benchは、AllenAIが2025年に公開したOCR文書解析ベンチマークデータセットです。このデータセットは、OCRシステムがPDF文書をMarkdown形式に変換する際の精度、および重要なテキスト情報と構造情報を完全に保持する能力を測定することを目的としています。関連する研究論文には、以下のようなものがあります。 olmOCR: ビジョン言語モデルで PDF 内の数兆個のトークンをロック解除 。 このデータセットには、1,403個のPDFファイルと7,010個のテストケースサンプルが含まれています。テストカテゴリは、arXivの数理論文、古いスキャン画像、表、ヘッダーとフッター、長文テキスト、複数列レイアウトなど、さまざまな文書形式を網羅しています。評価基準は、テキストの存在、テキストの除外検証、自然な読み順、表の正確性、数式の書式設定精度という5つの主要な指標で構成されています。
データセットの構成:
- arXiv_math: 522個のPDFソースファイルと2,927個のテストサンプルが含まれています。
- old_scans_math: 36個のPDFソースファイルと458個のテストサンプルが含まれています。
- tables_tests: 188個のPDFソースファイルと1,020個のテストサンプルが含まれています。
- old_scans: 98個のPDFソースファイルと526個のテストサンプルが含まれています。
- headers_footers: 266個のPDFソースファイルと753個のテストサンプルが含まれています。
- multi_column: 231個のPDFソースファイルと884個のテストサンプルが含まれています。
- long_tiny_text: 62個のPDFソースファイルと442個のテストサンプルが含まれています。