HyperAIHyperAI

Command Palette

Search for a command to run...

olmOCR-bench 文档解析基准数据集

日期

2 小时前

数据集组织

Allen Institute for Artificial Intelligence

论文 URL

2502.18443

许可证

Other

标签

olmOCR-bench 是由 AllenAI 于 2025 年发布的 OCR 文档解析基准数据集,该数据集旨在衡量 OCR 系统将 PDF 文档转换为 Markdown 格式时的准确性,以及确保关键文本与结构信息的完整保留的能力,相关论文成果为 olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models 。 该数据集包含 1,403 个 PDF 文件与 7,010 个测试用例样本。测试类别覆盖 arXiv 数学论文、陈旧扫描件、表格、页眉页脚、长文本以及多栏排版等多种文档形态。测试评估标准包括文本存在性、文本排除验证、自然阅读顺序、表格准确性及数学公式排版精度五项核心指标。

数据集构成:

  • arXiv_math:包含 522 个 PDF 源文件与 2,927 个测试样本
  • old_scans_math:包含 36 个 PDF 源文件与 458 个测试样本
  • tables_tests:包含 188 个 PDF 源文件与 1,020 个测试样本
  • old_scans:包含 98 个 PDF 源文件与 526 个测试样本
  • headers_footers:包含 266 个 PDF 源文件与 753 个测试样本
  • multi_column:包含 231 个 PDF 源文件与 884 个测试样本
  • long_tiny_text:包含 62 个 PDF 源文件与 442 个测试样本

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供