HyperAI

الملخص

نقدّم EQ-Bench، معيارًا جديدًا مصممًا لتقييم جوانب الذكاء العاطفي في النماذج اللغوية الكبيرة (LLMs). ونقيّم قدرة هذه النماذج على فهم العواطف المعقدة والتفاعلات الاجتماعية من خلال طلب منها التنبؤ بدرجة شدة الحالات العاطفية للشخصيات في حوارات. ويُظهر المعيار قدرة فعّالة على التمييز بين طيف واسع من النماذج. ووجدنا أن EQ-Bench يُظهر ارتباطًا قويًا مع معايير شاملة متعددة المجالات مثل MMLU (Hendrycks et al., 2020) (معامل الارتباط r=0.97)، مما يشير إلى أننا قد نكون قد اCaptured جوانب مشابهة للذكاء الشامل. كما يُنتج المعيار نتائج قابلة للتكرار بشكل عالٍ باستخدام مجموعة من 60 سؤالًا باللغة الإنجليزية. ونقدّم أيضًا كودًا مفتوح المصدر لخط أنابيب تقييم تلقائي عبر الرابط: https://github.com/EQ-bench/EQ-Bench، بالإضافة إلى لوحة تصنيف (Leaderboard) عبر الموقع: https://eqbench.com

الملخص

Samuel J. Paech

الملخص

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

HyperAI Newsletters

Samuel J. Paech

الملخص

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

HyperAI Newsletters

Samuel J. Paech

الملخص

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

HyperAI Newsletters

Command Palette

EQ-Bench: معيار للذكاء العاطفي نموذج لغوي كبير

Samuel J. Paech

الملخص

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

HyperAI Newsletters

Command Palette

EQ-Bench: معيار للذكاء العاطفي نموذج لغوي كبير

Samuel J. Paech

الملخص

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

HyperAI Newsletters

Command Palette

EQ-Bench: معيار للذكاء العاطفي نموذج لغوي كبير

Samuel J. Paech

الملخص

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

HyperAI Newsletters