HyperAIHyperAI

Command Palette

Search for a command to run...

مجموعة بيانات ExtractBench لاستخراج البنية المستندة إلى الوثائق

التاريخ

المؤسسة

LlamaIndex

رابط الورقة البحثية

2607.29677

الترخيص

Apache 2.0

يُعد ExtractBench مجموعة بيانات معيارية لاستخراج هيكل المستندات، أُصدرت بواسطة LlamaIndex في عام 2026. تهدف هذه المجموعة إلى توفير أساس تقييم موحد لأنظمة استخراج المعلومات من مستندات المؤسسات القائمة على مخططات (Schemas) محددة مسبقاً من قبل المستخدم. تدعم المجموعة البحث وتقييم قدرات النماذج في مهام الاستخراج المعقدة مثل استعادة القوائم الطويلة بشكل كامل، وتحديد الحقائق المتناثرة، وملء الحقول ذات التخطيط الكثيف. النتائج البحثية المتعلقة بها منشورة في الورقة العلمية بعنوان ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction.

تحتوي هذه المجموعة البيانات على 370 وثيقة حقيقية ومُولَّفة آلياً (إجمالي 4,869 صفحة)، تغطي 8 قطاعات تجارية و67 نوعًا من الوثائق. يمثل كل سجل حالة اختبار واحدة؛ حيث يكون الإدخال هو الوثيقة الكاملة والمخطط المحدد من قِبل المستخدم، بينما يكون الإخراج كائن JSON متوافقًا مع مواصفات المخطط، مصحوبًا برقم الصفحة وصندوق الحدود لمصدر كل قيمة مُستخرجة كأدلة. تم تصنيف كل وثيقة في هذا الأساس المعياري بناءً على خمسة أبعاد مستقلة: صعوبة المهمة، الصعوبة المدركة، بنية الجداول، طول الوثيقة، والقطاع التجاري، مما يسهل تعزيم الدرجات المنخفضة إلى أسباب محددة.

تكوين مجموعة البيانات:

  • مقسمة حسب الحجم إلى ثلاث مجموعات فرعية:

    • قصيرة (short): 252 حالة اختبار، 615 صفحة، لا تتجاوز أي وثيقة فيها الـ 10 صفحات.
    • متوسطة (medium): 98 حالة اختبار، 2,438 صفحة، يتراوح عدد الصفحات بين 11 و50 صفحة.
    • طويلة (long): 20 حالة اختبار، 1,816 صفحة، تزيد عن 50 صفحة لكل منها.
  • مصنفة حسب تحدي المهمة:

    • T1 اكتمال القوائم الطويلة: 154 وثيقة، تركز على الاستخراج الشامل للهياكر المتكررة.
    • T2 تحديد الحقائق في الوثائق الطويلة: 39 وثيقة، تركز على العثور الدقيق على حقائق معينة ضمن نصوص ضخمة.
    • T3 استخراج الوثائق المكثفة: 214 وثيقة، تركز على ملء الحقول تحت ظروف التخطيط المعقد، أو الخط اليدوي، أو التشويش الناتج عن المسوح الضوئية.

حقول البيانات:

  • id: معرف فريد لحالة الاختبار.
  • category: تقسيم مجموعة البيانات (قصيرة/متوسطة/طويلة).
  • pdf: المسار النسبي للوثيقة المصدر المقابلة.
  • data_schema: ترميز JSON لجدول Schema الذي يعرف التنسيق المطلوب التحقق منه للإخراج.
  • expected_output: نتيجة الاستخراج الحقيقية (Ground Truth) مشفرة بصيغة JSON.
  • field_rules: قواعد التقييم على مستوى الحقل مشفرة بصيغة JSON، وتشمل نوع المُقارن، مصدر الأدلة، وحالة التحقق.
  • repeated_structure: إعداد مفتاح الهوية المستخدم لمزامنة تسجيلات المصفوفة.
  • tags: وسائط تحليل متعددة الأبعاد، تشمل تحديات المهمة، الظروف المدركة، بنية الجدول، الطول، والقطاع التجاري.

الاقتباس المرجعي

@misc{zhang2026extractbenchbenchmarkschemaguidedenterprise,
      title={ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction},
      author={Boyang Zhang and Adrian Lyjak and Eli Stewart and Zhaoqi Li and Simon Suo},
      year={2026},
      eprint={2607.29677},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2607.29677},
}

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp