HyperAIHyperAI

Command Palette

Search for a command to run...

ExtractBench Benchmark-Datensatz Zur Strukturierten Extraktion Von Dokumenten

Datum

Organisation

LlamaIndex

Paper-URL

2607.29677

Lizenz

Apache 2.0

ExtractBench ist ein im Jahr 2026 von LlamaIndex veröffentlichtes Benchmark-Datensatz zur strukturierten Extraktion aus Dokumenten. Er zielt darauf ab, einen standardisierten Bewertungsmaßstab für unternehmensinterne Informationsextraktionssysteme bereitzustellen, die auf benutzerdefinierten Schemata basieren. Der Datensatz unterstützt Forschung und Modellbewertung bei komplexen Extraktionsaufgaben wie der vollständigen Wiederherstellung langer Listen, der präzisen Lokalisierung spärlicher Fakten sowie dem Ausfüllen dichter Layout-Felder. Die zugehörige wissenschaftliche Publikation lautet ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction).

Der Datensatz umfasst 370 echte und synthetische Dokumente (insgesamt 4.869 Seiten), verteilt auf acht Geschäftsbereiche und 67 Dokumenttypen. Jeder Eintrag stellt einen Testfall dar; Eingabe sind das vollständige Dokument und ein vom Benutzer definiertes Schema, während als Ausgabe ein konformes JSON-Objekt generiert wird. Zusätzlich werden Quellenseitennummer und Begrenzungsrahmen für jeden extrahierten Wert als Beleg angegeben. Dieser Benchmark klassifiziert jedes Dokument anhand fünf unabhängiger Dimensionen – Aufgabenschwierigkeit, wahrgenommene Schwierigkeit, Tabellenstruktur, Dokumentlänge und Geschäftsbereich –, um niedrige Punktzahlen spezifischen Ursachen zuordnen zu können.

Datensaufbau:

  • Unterteilung nach Umfang in drei Teildatensätze:

    • kurz: 252 Testfälle, 615 Seiten, maximal 10 Seiten pro Dokument
    • mittel: 98 Testfälle, 2.438 Seiten, zwischen 11 und 50 Seiten
    • lang: 20 Testfälle, 1.816 Seiten, mehr als 50 Seiten
  • Unterteilung nach Aufgabenherausforderungen::

    • T1 Vollständigkeit langer Listen: 154 Dokumente, Fokus auf die vollständige Extraktion wiederkehrender Strukturen
    • T2 Faktlokalisierung in langen Dokumenten: 39 Dokumente, Fokus auf die präzise Suche nach bestimmten Fakten in großen Textmengen
    • T3 Dichte Dokumentextraktion: 214 Dokumente, Fokus auf das Ausfüllen von Feldern trotz komplexer Formatierung, Handschrift oder Scan-Störungen

Datenfelder:

  • id: Eindeutiger Bezeichner des Testfalls
  • category: Einteilung des Datensatzes (kurz/mittel/lang)
  • pdf: Relativer Pfad zum entsprechenden Quelldokument
  • data_schema: Als JSON kodiertes JSON-Schema, welches das zu validierende Ausgabeformat definiert
  • expected_output: Als JSON kodiertes Ground-Truth-Ergebnis der Extraktion
  • field_rules: Als JSON kodierte feldspezifische Bewertungskriterien, einschließlich Vergleichstyp, Quellenbeleg und Validierungsstatus
  • repeated_structure: Konfiguration eines Identitätsschlüssels zur Alignment-Ausrichtung von Array-Einträgen
  • tags: Multidimensionale Analysetags, die Aufgabenherausforderung, Wahrnehmungsbedingungen, Tabellenstruktur, Länge und Geschäftsbereich abdecken

Zitation

@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
      title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
      author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
      year={2026},
      eprint={2607.29677},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2607.29677},
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp