تصنف لوحة قياس شاملة أداء أفضل نماذج الذكاء الاصطناعي
أطلقت شركة Kerv، تحت إشراف المهندس المعماري للذكاء الاصطناعي التطبيقي إيد ياو، لوحة تقييم شاملة لنماذج الذكاء الاصطناعي التوليدي المعروفة بـ Ed-o-meter، والتي تهدف إلى قياس أداء النماذج اللغوية الكبيرة في بيئات عمل واقعية بدلاً من الاعتماد على المقاييس الأكاديمية التقليدية. وتُدار منصة التقييم عبر أداة مفتوحة المصدر تسمى Featherbench، وتختبر سبعة عشر نموذجاً رائداً عبر ثمانية وعشرين مهمة عملية موزعة على خمس فئات رئيسية تشمل البرمجة، ومعالجة البيانات، والسيناريوهات الواقعية، والأمن السيبراني، واستخدام الأدوات. أظهرت نتائج التحديث الأحدث الصادر في 23 أغسطس 2026، الذي أضيفت خلاله نماذج مثل GLM-5.3 وGrok-4.6 وDeepSeek-V4-Pro وGemini-3.7-Flash، تفوقاً واضحاً لنموذج GLM-5.3. حقق النموذج نسبة نجاح تبلغ 100 بالمائة عبر جميع الفئات، مع تكلفة إجمالية تبلغ 0.28 دولار لكل مهمة، مما يجعله الخيار الأكثر اقتصاداً وكفاءة مقارنة بنماذج الجيل الخامس المتقدمة. وفي المقابل، برز نموذج GPT-5.5 كخيار مثالي للتطبيقات التي تتطلب سرعة استجابة عالية، حيث سجل زمنياً 13.2 ثانية للوصول إلى أول رمز، متفوقاً على GLM-5.3 الذي يستغرق 16.3 ثانية. وفيما يخص الكفاءة الاقتصادية للمهام القابلة لإعادة المحاولة أو منخفضة المخاطر، يبقى GPT-5.6-Luna هو الخيار الأنسب، بينما يوصى بـ Sonnet-4-6 للموازنة بين الجودة الزمنية والدقة، مع تفوق Haiku-4-5 في تحقيق النتائج الدقيقة من المحاولة الأولى. تستند منهجية التقييم إلى محاكاة تسمى حلبة السباق، تقيس كل نموذج في مسار ثابت يشمل البرمجة والبيانات والسيناريوهات الواقعية والأمان والأدوات. ويتم تلوين النتائج بناءً على نسبة النجاح، حيث يشير اللون الأخضر إلى تجاوز 85 بالمائة من النجاح. وتكمن قيمة هذه المنصة في توفيرها إطار عمل مفتوح المصدر يسمح للمطورين بتكرار التجارب، أو مقارنة النماذج بشكل مباشر، أو اقتراح نماذج جديدة عبر منصة GitHub، حيث تبلغ تكلفة تشغيل الاختبار الكامل أقل من 30 دولاراً. يعود تاريخ إصدار هذه اللوحة إلى 19 يوليو 2026، مع تحديثات متتالية في 29 يوليو و5 أغسطس لدمج إصدارات جديدة من مجموعة نماذج Claude وGemini وGrok وDeepSeek، وتعديل التكاليف بعد خفض أسعار OpenAI. وتشير النتائج إلى تحول جوهري في تقييم الذكاء الاصطناعي، حيث تتحول المعايير من الأرقام النظرية إلى اختبارات وحدة عملية تخدم تطبيقات الوكلاء الذكيين، مما يوفر للفرق التقنية دليلاً شاملاً ومحدَّثاً لاتخاذ قرارات التوظيف التقني بدقة وكفاءة، مع الحرص على مراعاة متطلبات الامتثال والأمان عند اعتماد النماذج في البيئات المؤسسية.
