Command Palette
Search for a command to run...
Jeu De Données De Référence Pour l'analyse Syntaxique De Documents olmOCR-bench
olmOCR-bench est un jeu de données de référence pour l'analyse syntaxique de documents par reconnaissance optique de caractères (OCR), publié par AllenAI en 2025. Ce jeu de données vise à mesurer la précision des systèmes OCR lors de la conversion de documents PDF au format Markdown, ainsi que leur capacité à garantir la préservation intégrale des informations textuelles et structurelles essentielles. Articles de recherche associés : olmOCR : Débloquer des milliards de jetons dans les PDF grâce aux modèles de langage de vision . Cet ensemble de données contient 1 403 fichiers PDF et 7 010 exemples de cas de test. Les catégories de test couvrent une variété de formats de documents, notamment des articles mathématiques d'arXiv, d'anciennes numérisations, des tableaux, des en-têtes et pieds de page, des textes longs et des mises en page à plusieurs colonnes. Les critères d'évaluation comprennent cinq indicateurs principaux : la présence de texte, la vérification de l'exclusion de texte, l'ordre de lecture naturel, l'exactitude des tableaux et la précision de la mise en forme des formules mathématiques.
Composition de l'ensemble de données :
- arXiv_math : Contient 522 fichiers sources PDF et 2 927 exemples de test.
- old_scans_math : Contient 36 fichiers sources PDF et 458 exemples de test.
- tables_tests : Contient 188 fichiers sources PDF et 1 020 échantillons de test.
- old_scans : Contient 98 fichiers sources PDF et 526 échantillons de test.
- headers_footers: Contient 266 fichiers sources PDF et 753 exemples de test.
- multi_column : Contient 231 fichiers sources PDF et 884 échantillons de test.
- long_tiny_text: Contient 62 fichiers sources PDF et 442 exemples de test.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.