HyperAIHyperAI

Command Palette

Search for a command to run...

Extraction Bench : Jeu De Données Pour L'évaluation De La Structuration Des Documents Par Extraction

Date

Organisation

LlamaIndex

URL du document

2607.29677

Licence

Apache 2.0

ExtractBench est un jeu de données d'évaluation pour l'extraction structurée des documents, publié par LlamaIndex en 2026. Il vise à fournir une norme d’évaluation standardisée pour les systèmes d’extraction d’informations dans les documents d’entreprise basés sur des schémas définis par l’utilisateur (schema). ExtractBench prend en charge la recherche et l’évaluation des capacités des modèles pour des tâches complexes telles que la restauration complète de longues listes, le repérage précis de faits épars ou rares, ainsi que le remplissage dense de champs dans des mises en page complexes. Les résultats scientifiques associés sont publiés sous forme d'article intitulé « ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction » (https://hyper.ai/papers/2607.29677).

Ce jeu de données comprend 370 documents réels et synthétiques (totalisant 4 869 pages), couvrant huit secteurs commerciaux et soixante-sept types de documents différents. Chaque entrée constitue un cas de test : l'entrée consiste en un document complet accompagné du schéma utilisateur défini ; la sortie correspond à un objet JSON conforme au schéma spécifié, avec comme preuve chaque valeur extraite annotée du numéro de sa page source et de son encadré délimitateur (bounding box). Le benchmark attribue à chaque document cinq étiquettes indépendantes selon les dimensions suivantes : difficulté objective de la tâche, difficulté perçue, complexité des tableaux, longueur du document et secteur métier, ce qui permet d’attribuer précisément les scores faibles aux causes spécifiques.

Composition du jeu de données :

  • Répartition selon la longueur des documents en trois sous-ensembles :

    • court : 252 cas de tests, 615 pages, aucun document ne dépassant 10 pages
    • moyen : 98 cas de tests, 2 438 pages, entre 11 et 50 pages incluses
    • long : 20 cas de tests, 1 816 pages, plus de 50 pages
  • Répartition selon le type de défi posé :

    • T1 Complétude de longue liste : 154 documents, axés sur l’exhaustivité des structures répétitives
    • T2 Localisation factuelle dans longs documents : 39 documents, axés sur la localisation précise de faits particuliers parmi de grands volumes textuels
    • T3 Extrait dense de document : 214 documents, axés sur le remplissage de champs malgré des mises en page complexes, du texte manuscrit ou des artefacts numérisés

Champs de données :

  • id : identifiant unique du cas de test
  • category : catégorie attribuée dans le jeu de données (court/moyen/long)
  • pdf : chemin relatif vers le document source correspondant
  • data_schema : schéma JSON codé en chaîne JSON (format JSON Schema), définissant le format attendu et validable des sorties
  • expected_output : résultat réel extrait, également codé en chaîne JSON
  • field_rules : règles de notation niveau champ, codées en chaîne JSON, incluant le type de comparateur, la provenance des preuves et l’état de validation
  • repeated_structure : configuration de clé permettant d’aligner les entrées de tableau
  • tags : étiquettes multidimensionnelles utilisées pour l’analyse croisée, couvrant le défi de la tâche, les conditions perceptuelles, la structure tabulaire, la longueur et le domaine commercial

Référence bibliographique

@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
      title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
      author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
      year={2026},
      eprint={2607.29677},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2607.29677},
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp