Command Palette
Search for a command to run...
olmOCR-bench-Benchmark-Datensatz Für Die Dokumentenanalyse
olmOCR-bench ist ein von AllenAI im Jahr 2025 veröffentlichter Benchmark-Datensatz für die OCR-Dokumentenanalyse. Dieser Datensatz dient der Messung der Genauigkeit von OCR-Systemen bei der Konvertierung von PDF-Dokumenten in das Markdown-Format sowie ihrer Fähigkeit, die vollständige Erhaltung wichtiger Text- und Strukturinformationen zu gewährleisten. Zugehörige Forschungsarbeiten umfassen… olmOCR: Billionen von Token in PDFs mit Vision Language Models freischalten . Dieser Datensatz umfasst 1.403 PDF-Dateien und 7.010 Testbeispiele. Die Testkategorien decken verschiedene Dokumentformate ab, darunter mathematische Artikel von arXiv, ältere Scans, Tabellen, Kopf- und Fußzeilen, längere Texte und mehrspaltige Layouts. Die Bewertungskriterien umfassen fünf Kernmetriken: Textpräsenz, Überprüfung auf Textausschluss, natürliche Lesereihenfolge, Genauigkeit der Tabellen und Präzision der Formatierung mathematischer Formeln.
Zusammensetzung des Datensatzes:
- arXiv_math: Enthält 522 PDF-Quelldateien und 2.927 Testbeispiele.
- old_scans_math: Enthält 36 PDF-Quelldateien und 458 Testbeispiele.
- tables_tests: Enthält 188 PDF-Quelldateien und 1.020 Testbeispiele.
- old_scans: Enthält 98 PDF-Quelldateien und 526 Testbeispiele.
- headers_footers: Enthält 266 PDF-Quelldateien und 753 Testbeispiele.
- mehrspaltig: Enthält 231 PDF-Quelldateien und 884 Testbeispiele.
- long_tiny_text: Enthält 62 PDF-Quelldateien und 442 Testbeispiele.
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.