Command Palette
Search for a command to run...
olmOCR-bench 文档解析基准数据集
olmOCR-bench 是由 AllenAI 于 2025 年发布的 OCR 文档解析基准数据集,该数据集旨在衡量 OCR 系统将 PDF 文档转换为 Markdown 格式时的准确性,以及确保关键文本与结构信息的完整保留的能力,相关论文成果为 olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models 。 该数据集包含 1,403 个 PDF 文件与 7,010 个测试用例样本。测试类别覆盖 arXiv 数学论文、陈旧扫描件、表格、页眉页脚、长文本以及多栏排版等多种文档形态。测试评估标准包括文本存在性、文本排除验证、自然阅读顺序、表格准确性及数学公式排版精度五项核心指标。
数据集构成:
- arXiv_math:包含 522 个 PDF 源文件与 2,927 个测试样本
- old_scans_math:包含 36 个 PDF 源文件与 458 个测试样本
- tables_tests:包含 188 个 PDF 源文件与 1,020 个测试样本
- old_scans:包含 98 个 PDF 源文件与 526 个测试样本
- headers_footers:包含 266 个 PDF 源文件与 753 个测试样本
- multi_column:包含 231 个 PDF 源文件与 884 个测试样本
- long_tiny_text:包含 62 个 PDF 源文件与 442 个测试样本