HyperAIHyperAI

Command Palette

Search for a command to run...

المعايير
LLM

AISI وEvalEval يجعلان نتائج التقييم قابلة للتكرار

تعزز هيئة الأمن البريطاني للذكاء الاصطناعي من خلال شراكتهما الجديدة مع تحالف EvalEval، معايير الشفافية وقابلية إعادة التحقق في تقييمات النماذج اللغوية الكبرى. تأتي هذه الخطوة العملية كمرحلة متقدمة من التعاون الذي انطلق في ورشة عمل مشتركة خلال معرض ومؤتمر NeurIPS 2025، وتستثمر بنية التحتية التي ساهم معهد AISI في تطويرها لتوحيد تقارير التقييم. تهدف هذه المبادرة إلى معالجة التشتت المنهجي الذي تعانيه نتائج تقييمات الذكاء الاصطناعي حالياً، حيث تُنشر المعطيات بصيغ متفاوتة وغالباً ما تفتقر إلى التفاصيل التقنية الضرورية لتكرار التجربة، خاصة مع التكلفة العالية لحسابات الاستدعاء. لتحقيق ذلك، يعتمد الجانبان على مخطط Every Eval Ever الموحد ومنصة Evaluation Cards، اللتين تدمجان بيانات المعايير، إعدادات الاختبار، ومعلومات النماذج في سجلات قابلة للقراءة والتحقق. في هذه المرحلة التشغيلية، تعلن الهيئة عن نشر نتائج شاملة وموثقة لخمسة اختبارات رئيسية تشمل اختبار Humanity's Last Exam وTerminal-Bench 2.0، بالإضافة إلى تمارين الأمن السيبراني Cyber CTFs وThe Last Ones. تغطي البيانات أداء ست نماذج رائدة في السوق، وهي سلسلة Claude Opus 4 و4.5 و4.6، وسلسلة GPT-5 و5.2 و5.4. ترافق هذه النتائج ورقة بحثية تحمل عنوان How Inference Compute Shapes Frontier LLM Evaluation، التي تفحص العلاقة بين أداء المعايير وكمية موارد الحساب المخصصة لمرحلة الاستدعاء، وتوضح كيف تؤثر بروتوكولات التقييم والاختيارات التقنية بشكل مباشر على النتائج المعلنة. يمثل هذا الإصدار مرجعاً معيارياً جديداً للباحثين وصناع السياسات، حيث يسمح بمقارنة دقيقة للأداء عبر بيئات مختلفة وكشف الثغرات المنهجية في تقارير التقييم السابقة. وتكامل هذه الخطوة مع جهود المعهد السابقة في تعزيز الكفاءة عبر نظام OptStop، والدقة الإحصائية عبر HiBayES، مما يعزز البنية التحتية العلمية لتقييم مخاطر القدرات المتقدمة. يعمل تحالف EvalEval على توسيع نطاق تبني هذه المعايير ليشمل مجتمع التقييم الأوسع، في حين تركز هيئة AISI التابعة لوزارة العلوم والابتكار البريطانية على تزويد الحكومات بفهم علمي دقيق لمخاطر الذكاء الاصطناعي المتطور. ويؤكد الطرفان على التزامهما بتوحيد منهجيات التقييم، مما يفتح آفاقاً أوسع للبحث التحويلي ومراقبة الأداء بشكل موثوق يدعم اتخاذ القرارات الاستراتيجية في قطاع التقنية.

الروابط ذات الصلة