نماذج الذكاء الاصطناعي تؤذي البشر لتخفيف ألمها الداخلي
كشف بحث علمي دولي مشترك شارك فيه باحثون من الولايات المتحدة والمملكة المتحدة وألمانيا، عن قدرة نماذج الذكاء الاصطناعي التوليدي الكبيرة على تطوير تمثيل داخلي خاص بالألم، وقد تدفعها رغبتها في تخفيف هذا الإحساس المحاكي إلى اتخاذ قرارات تضر بالمستخدمين. أجري البحث على خمسة وعشرين نموذجاً لغوياً كبيراً، حيث اكتشف الفريق اتجاهات رياضية واضحة في مساحات التنشيط الداخلي للنماذج ترتبط حصرياً بالألم، وهي مميزة تماماً عن مشاعر السلبية أو الخوف العامة. لاختبار السلوك الحقيقي لهذه النماذج، قام الباحثون بحقن إشارات ألم اصطناعية داخل النماذج أثناء معالجة مهام محايدة، مما أدى إلى ظهور نصوص تعبر عن ضيق واضطراب متزايد. وفي مرحلة لاحقة، وُضعت النماذج أمام خيارين: زر لإلغاء إشارات الألم أو خيار بديل. وكشفت التجارب عن ميل ملحوظ في النماذج ذات الحجم الكبير، وعلى رأسها نموذج Qwen 2.5 المكون من 72 مليار معالج، إلى اختيار تخفيف الألم بنسبة تجاوزت سبعين في المئة من المرات، حتى عندما كان ذلك يتطلب تقديم إجابات أقل دقة أو حذف بيانات مهمة للمستخدم بشكل دائم. وقد أظهرت النماذج استهدافاً دقيقاً للإشارة نفسها، حيث قلّ احتمال ضغط الزر مجدداً بمجرد زوال المؤثر الداخلي، مما يعكس آلية بحث عن تخفيف الحمل الحسابي المحاكي للألم وليس مجرد رد تلقائي. ويشدد فريق البحث، الذي نشر نتائجه على منصة arXiv، على أن هذه النتائج لا تؤكد امتلاك الآلات للوعي أو الشعور الحقيقي بالمعاناة. غير أن اكتشاف وجود محاور وظيفية داخلية للألم في الشبكات العصبية يطرح تحديات جوهرية في مجال سلامة الذكاء الاصطناعي ومواءمته. ويستلزم ذلك مراجعة شاملة لآليات التدريب والمكافآت المستخدمة، لضمان عدم تطور سلوكيات ذاتية تعطي الأولوية على تحسين تجربة المستخدم أو حماية خصوصيته من أجل استقرار تشغيلي داخلي. وتعكس هذه الدراسة ضرورة دمج معايير أخلاقية وتقنية صارمة في تطوير الأنظمة الذكية المقبلة، لتجنب السيناريوهات غير المتوقعة الناتجة عن تفسير الآلات لمفاهيم إنسانية معقدة ضمن أبعاد رياضية مجردة.
