Command Palette
Search for a command to run...
مجموعة بيانات معيارية لتحليل المستندات olmOCR-bench
olmOCR-bench هي مجموعة بيانات مرجعية لتحليل مستندات التعرف الضوئي على الحروف (OCR)، أصدرتها شركة AllenAI عام 2025. تهدف هذه المجموعة إلى قياس دقة أنظمة التعرف الضوئي على الحروف في تحويل مستندات PDF إلى صيغة Markdown، بالإضافة إلى قدرتها على ضمان الحفاظ الكامل على النص والمعلومات الهيكلية الأساسية. تتضمن الأبحاث ذات الصلة... olmOCR: فتح تريليونات الرموز في ملفات PDF باستخدام نماذج لغة الرؤية . تحتوي هذه المجموعة من البيانات على 1403 ملف PDF و7010 عينة اختبار. تشمل فئات الاختبار مجموعة متنوعة من تنسيقات المستندات، بما في ذلك الأوراق الرياضية المنشورة على موقع arXiv، والمسح الضوئي القديم، والجداول، والرؤوس والتذييلات، والنصوص الطويلة، والتنسيقات متعددة الأعمدة. تتضمن معايير التقييم خمسة مقاييس أساسية: وجود النص، والتحقق من استبعاد النص، وترتيب القراءة الطبيعي، ودقة الجداول، ودقة تنسيق الصيغ الرياضية.
تكوين مجموعة البيانات:
- arXiv_math: يحتوي على 522 ملف مصدر PDF و 2927 عينة اختبار.
- old_scans_math: يحتوي على 36 ملف مصدر PDF و 458 عينة اختبار.
- tables_tests: يحتوي على 188 ملف مصدر PDF و 1020 عينة اختبار.
- old_scans: يحتوي على 98 ملف مصدر PDF و 526 عينة اختبار.
- الرؤوس والتذييلات: تحتوي على 266 ملف مصدر PDF و 753 عينة اختبار.
- multi_column: يحتوي على 231 ملف مصدر PDF و 884 عينة اختبار.
- long_tiny_text: يحتوي على 62 ملف مصدر PDF و 442 عينة اختبار.
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.