HyperAIHyperAI

Command Palette

Search for a command to run...

NeoMME يطلق مشفرًا متعدد الوسائط واللغات عالي الكفاءة

أعلنت شركة H، وبمشاركة المطورين أورييلين لاك وتوني وو، عن إطلاق NeoMME، عائلة جديدة من نماذج الترميز متعددة الوسائط والمتعددة اللغات. يتميز هذا الإنجاز بمعماريته الموحدة التي تتجاوز الاعتماد على نماذج رؤية ومعاجم لغوية منفصلة، حيث يعتمد على محول اتجاهي واحد لمعالجة رموز النص ولطخات الصور الخام في مسار حسابي موحد. تم تدريب النموذج من الصفر باستخدام تقنية الانتشار المنفصل المقنع، مما يمكّنه من استيعاب سياقات طويلة تصل إلى 16384 رمزاً مع الحفاظ على كفاءة عالية في الربط بين المحتوى النصي والمرئي. يركز التطبيق الرئيسي للنموذج على استرجاع المستندات المرئية من خلال إصدار مخصص يُعرف بـ NeoMME-Retriever. يوفر هذا الإصدار تمثيلات كثيفة وتمثيلات تفاعل متأخر خلال تمرير أمامي واحد، مما يوفر مرونة تشغيلية عالية. سجل النموذج أداءً قيادياً على معيار ViDoRe v3، حيث تفوق حجمه المكون من 260 مليون معامل على جميع النماذج الأقل من 800 معامل، بينما حقق حجم الـ 800 مليون معامل نتائج منافسة لنماذج تضاعف حجمه مع استهلاك موارد أقل بكثير. كما تفوق معدل استنتاجه على ضعف سرعة المنافس المعتمد، حيث يعالج نحو 51 صفحة في الثانية بدقة 2048×2048 على معالجات NVIDIA L40S. للتغلب على التحدي التقليدي المتمثل في الحجم التخزيني الكبير لتمثيلات التفاعل المتأخر، طوّر الفريق تقنيات ضغط متقدمة تجمع بين تجميع الرموز التسلسلي والكمية غير المتماثلة. أتاحت هذه الآليات تقليل مساحة الفهرس من 1.5 ميجابايت إلى 6 كيلوبايت لكل صفحة، بنسبة ضغط تصل إلى 255 ضعفاً مع الحفاظ على أكثر من 95% من دقة الاسترجاع الأصلية. يُمكّن هذا الإنفاق أنظمة الاسترجاع المعزز بالتوليد البصرية من دمج الصور الأصلية للجداول والرسوم البيانية مباشرة مع النماذج اللغوية دون الاعتماد على استخراج النصوص الذي قد يفقد السياق البصري. تم نشر جميع نسخ NeoMME على منصة Hugging Face Transformers تحت رخصة Apache 2.0، متاحة فوراً للاستخدام البحثي والتطبيقات الصناعية. يُمثل هذا المشروع خطوة جوهرية نحو هندسة نماذج متعددة الوسائط أكثر كفاءة من حيث الحوسبة والتخزين، مع دعم متعمد للغة العربية والرموز متعددة اللغات ضمن مساحة معجمية مدربة من الصفر.

الروابط ذات الصلة