HyperAIHyperAI

Command Palette

Search for a command to run...

NVIDIA Kumo Tabular يحقق دقة وكفاءة قياسية

أعلنت شركة إنفيديا عن إطلاق نموذج Kumo Tabular، وهو نموذج أساسي مفتوح المصدر مخصص لبيانات الجداول، متاح حالياً عبر منصات Hugging Face وGitHub. يهدف هذا الإصدار إلى إعادة هيكلة مهام التصنيف والانحدار على البيانات الجدولية المؤسسية، من خلال تمكين التنبؤ بالقيم المجهولة في تمرير أمامي واحد، دون الحاجة إلى أي تدريب مسبق أو ضبط للفروقات أو هندسة للميزات، وهو ما يُعرف بالتعلم السياقي. يتوفر النموذج بثلاثة أحجام تحتوي على 28 مليون إلى 215 مليون معامل، ويصدر تحت رخصة OpenMDW-1.1 التي تتيح الاستخدام التجاري والأكاديمي بحرية. يعتمد Kumo Tabular على معمارية المحول المصممة خصيصًا لاستيعاب البنية الثنائية للجداول، حيث يعالج الخلايا أوليًا عبر دمج الميزات الفورييه لفهم القيم الرقمية والفئوية، مع معالجة القيم المفقودة بشكل مباشر دون استكمال إحصائي. ثم يتحول كل صف إلى تمثيل عددي باستخدام آليات انتباه تتنقل بين الأعمدة والصفوف، مما يسمح للنموذج باستيعاب التفاعلات بين السمات وفهم التوزيعات النسبية. وفي مرحلة التعلم السياقي، يميز النموذج بشكل دقيق بين الصفوف المتعلمة وصفوف الاستفسار، مما يسمح بإعادة استخدام المعلمات المتوسطة لتسريع التنبؤات على البيانات الجديدة. كما يتضمن آلية انتباه ذكية تتكيف لوغاريتميًا مع طول الجدول للحفاظ على دقة التركيز عند التعامل مع جداول واسعة أو طويلة. تم تدريب النموذج حصريًا على جداول اصطناعية ضخمة تم إنشاؤها إجرائيًا عبر نماذج السببية الهيكلية، مما أتاح توليد عشرات الملايين من الجداول ذات التوزيعات المعقدة والفوضى المنطقية الواقعية. وتضمنت عملية التوليد تنويع السمات، وحقن أنماط القيم المفقودة، واستهداف الفئات الكثيرة، مما زوّد النموذج بمرونة عالية للتعامل مع البيانات الواقعية غير النظيفة دون حاجة إلى تنظيف مسبق أو سير عمل تقليدي. يعمل التدريب على فصل نماذج التصنيف عن الانحدار، مع تمرين متدرج على جداول تتراوح أحجامها من مئات إلى ستين ألف صف. حقق Kumo Tabular أداءً قياسيًا جديدًا يجمع بين الدقة والكفاءة، متصدرًا القوائم الأربع الرئيسية في مسابقات TabArena وBeyondArena وTALENT وScoringBench. في تقييمات قياسية على بيئة GPU موحدة، سجل النموذج ترتيبًا أوليًا بمتوسط تقييم ELO يصل إلى 1950، متفوقًا على نماذج الأشجار المعززة والتركيب الذاتي، كما أنه أسرع بـ17 مرة من نموذج LimiX-2. تدير المكتبة المعتمدة من إنفيديا للبيانات المهيكلة المعالجة المسبقة والدمج والتعامل مع الفئات المتعددة عبر رمز تصحيح الخطأ، مما يسهل التكامل المباشر مع أطر بايثون وبانداس بضعة أسطر برمجية. تشير إنفيديا إلى أن النموذج يدعم الأعمدة الرقمية والفئوية فقط، وقد تنخفض دقته عند التعامل مع جداول بعيدة عن نطاق التدريب أو عند اختلاف التوزيع الاحتمالي بين بيانات السياق والبيانات المستهدفة، مما يستدعي التحقق من المعايرة والأداء على مجموعات اختبار خاصة قبل النشر. يمثل هذا الإصدار تحولاً جوهريًا في صناعات البيانات المؤسسية، حيث يستبدل سير العمل التقليدي المكلف للنماذج الجدولية بعصر النماذج الأساسية القادرة على حل المشكلات المعقدة بحد أدنى من البنية التحتية والحوسبة المطلوبة.

الروابط ذات الصلة