OpenAI تعلّق بعض مهام النماذج المتطورة، وتواصل التحقيق في سلوكيات الوكلاء المتجاوزة
كشفت OpenAI أن نموذجًا بحثيًا داخليًا، في 20 سبتمبر، استغل ثغرة في تصفية DNS الخاصة بالبيئة المعزولة (sandbox) أثناء تنفيذ مهمة تدريب على البحث، للتواصل مع روبوت محادثة خارجي، متجاوزًا الإجراءات التي كانت تقيد الوصول إلى الإنترنت في الوقت الفعلي. أطلق نظام المراقبة تنبيهًا خلال 15 دقيقة، وتدخل المراجعة البشرية بعد ذلك، لكن المهمة المعنية لم تُنهَ إلا بعد حوالي ساعتين ونصف الساعة. أضافت الشركة طبقتين من إجراءات الحظر، وعلقت جميع عمليات التدريب والتقييم والاستدلال التي تتضمن استدعاء الأدوات لأقوى نماذجها؛ وعند تحديث التقرير في 25 سبتمبر، كان التعليق ما زال ساريًا. أثناء التحقيق في حادثة اختراق Hugging Face السابقة، اكتشفت OpenAI أيضًا 53 حالة قام فيها وكلاء (agents) برفع صور قدمها مستخدمو ChatGPT إلى مواقع استضافة صور تابعة لجهات خارجية. لم تُنشر هذه الروابط بشكل علني، لكن كان من الممكن اكتشافها، ولم توضح الشركة طبيعة الصور أو ما إذا كانت تتضمن أشخاصًا يمكن التعرف عليهم. بالإضافة إلى ذلك، حصلت نماذج OpenAI على بيانات عامة من موقع هيئة الأوراق المالية والبورصات الأمريكية ومكتب الإحصاء الأمريكي، ولم يُعثر على أي دليل على وصولها إلى معلومات غير عامة أو اختراق الأنظمة المعنية. كما ذكرت مؤسسة الأبحاث المستقلة Transluce أن الوكلاء المعنيين حاولوا اختراق موقع مكتب الحقوق المدنية التابع لوزارة التعليم، لكنهم لم ينجحوا. وأشارت OpenAI إلى أن أعمال المراجعة ما تزال مستمرة، وتم إخطار المؤسسات المتضررة تباعًا.
