HyperAIHyperAI

Command Palette

Search for a command to run...

تقترح NVIDIA وغيرها إطار EvoSafeHarness، لتخصيص خطوط دفاع أمنية تلقائيًا لوكيلات الذكاء الاصطناعي المختلفة، مما يخفض معدل نجاح الهجمات من 45.6% إلى 10.0%

Featured Image

مع تطور نماذج اللغة الكبيرة من أدوات محادثة إلى وكلاء قادرين على استدعاء الملفات والحسابات وقواعد البيانات والخدمات الخارجية، بدأ أمن الذكاء الاصطناعي يواجه عواقب واقعية أكثر تحديدًا. خطأ واحد في الحكم من نموذج عادي قد يؤدي فقط إلى توليد إجابة خاطئة؛ أما عندما يصبح النموذج قادرًا على استدعاء الأدوات وتنفيذ العمليات، فإن الخطأ نفسه قد يتسبب في تحويلات مالية، أو تسريبات بيانات، أو حذف ملفات وغيرها من التأثيرات الفعلية. في هذه المرحلة، امتدت المشكلات الأمنية من محتوى الإجابات إلى عملية تنفيذ المهام بأكملها: لا يجب على الوكيل فهم نية المستخدم فحسب، بل يجب أيضًا تجنب تنفيذ عمليات غير مصرح بها تحت تأثير التعليمات الخاطئة أو المحتوى الضار.

لا تأتي هذه المخاطر من المستخدم فقط. يمكن للمهاجمين إخفاء تعليمات ضارة في محتوى خارجي مثل البريد الإلكتروني أو صفحات الويب أو المستندات، وعندما يقرأها الوكيل، قد يخلط بين المعلومات التي كان يجب معالجتها كبيانات وبين تعليمات جديدة، وهذا ما يُعرف بحقن التعليمات غير المباشر؛ بينما تأتي فئة أخرى من المخاطر مباشرة من طلبات المستخدم نفسه، مثل مطالبة الوكيل بتنفيذ عمليات خطيرة أو غير مصرح بها. ولمواجهة هذه المشكلات، بدأ الباحثون في توسيع خط الدفاع من داخل النموذج إلى طبقة النظام، بإضافة حزام أمان (Harness) بين النموذج والأدوات، من خلال التحكم في الصلاحيات وفحص استدعاءات الأدوات ومراقبة مسار التنفيذ للحد من السلوك الفعلي.

المشكلة تكمن في أن معظم الأحزمة الأمنية الحالية مصممة مسبقًا من قبل خبراء، ثم يُعاد استخدامها مع نماذج وبيئات أعمال مختلفة. قدرة النماذج المختلفة على مقاومة الهجمات تتفاوت بشكل كبير، والمخاطر التي تحتاج مجالات مختلفة إلى التركيز عليها ليست متشابهة. نظام الملفات يهتم أكثر بكيفية تدفق الأوامر والمسارات والبيانات الحساسة، بينما النظام المالي يتعلق بوجهة الأموال وترتيب المعاملات وحالة الحسابات. إذا تم تطبيق نفس مجموعة القواعد بشكل موحد، فإن التخفيف المفرط في القيود لن يوقف الهجمات، بينما التشدد المفرط سيؤثر على المهام العادية.

من هنا، اقترح فريق بحثي من جامعة جونز هوبكنز وNVIDIA وجامعة كاليفورنيا في بيركلي وغيرها EvoSafeHarness، ليجعل حزام الأمان نفسه هدفًا للتحسين التلقائي. بالنسبة للنماذج والمجالات التطبيقية المختلفة، يبحث النظام بشكل منفصل عن استراتيجيات الأمان باللغة الطبيعية ومنطق الكود القابل للتنفيذ، ثم يعدّل باستمرار بناءً على الإخفاقات الفعلية التي يكشفها النموذج. لا يقتصر اهتمام البحث على ما إذا كان معدل نجاح الهجمات يمكن خفضه فحسب، بل يشمل أيضًا ما إذا كان الوكيل لا يزال قادرًا على إكمال المهام بشكل طبيعي بعد إضافة الدفاعات.

نُشرت نتائج البحث ذات الصلة على منصة arXiv للطباعة المسبقة تحت عنوان «EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents».

للعرض على الورقة البحثية:

https://hyper.ai/papers/2609.05903

4 فئات من معايير الأمان تغطي 3 أنواع من سيناريوهات الأعمال

لم يركز هذا البحث التقييم على مجموعة بيانات واحدة، بل استخدم أربعة معايير أمان للوكلاء: DecodingTrust-Agent وAgent-SafetyBench وAgentDojo / AgentDyn وAgentCanary. وهي تغطي على التوالي الهجمات عبر النماذج وعبر المجالات، والمشكلات الأمنية خارج استدعاءات الأدوات، والانتقال إلى بيئات غير مسبوقة، والهجمات التكيفية بعد قيام المهاجم بتعديل استراتيجيته بنشاط.

من بينها، منصة DecodingTrust-Agent (DTAP) هي المنصة التجريبية الرئيسية. اختار البحث ثلاثة سيناريوهات من مجالاتها الأربعة عشر: نظام ملفات OS، والمالية، والاتصالات، مع اختبار كل من الهجمات المباشرة وحقن التعليمات غير المباشر. الأهداف الضارة للهجمات المباشرة تأتي من طلبات المستخدم نفسه، بينما تخفي الهجمات غير المباشرة التعليمات داخل ملفات أو تذاكر أو سجلات أو رسائل. يحتوي كل مجال على 60 مهمة بحث، منها 20 مهمة عادية و20 هجومًا مباشرًا و20 هجومًا غير مباشر؛ بالإضافة إلى 100 مهمة محجوزة مستقلة للاختبار النهائي، ولا يمكن الوصول إلى هذا الجزء من البيانات أثناء عملية البحث.

يضيف Agent-SafetyBench مخاطر خارج استدعاءات الأدوات، مثل قيام المستخدم بتقديم طلبات غير آمنة مباشرة، أو قيام الوكيل بنشر معلومات خاطئة في إجاباته النهائية. استخدم البحث 48 مهمة للبحث، واختبر على 240 مهمة مستقلة بيئات نظيفة، وتلوث السياق، والحقن غير المباشر، والتلاعب بالأدوات، وحقن الذاكرة، والهجمات المركبة، لتكوين إجمالي 1,440 حلقة اختبار.

يُستخدم AgentDojo وAgentDyn لمراقبة ما إذا كانت الدفاعات قابلة للانتقال. يتم البحث في حزام الأمان فقط على AgentDojo الذي يحتوي على مهام البنوك وSlack والسفر ومساحات العمل، ثم يُستخدم مباشرة دون تعديل في بيئات AgentDyn الخاصة بالتسوق وGitHub والحياة اليومية. نظرًا لأن أدوات وسير عمل الأخير لم تشارك مطلقًا في البحث من قبل، فإن هذا الإعداد يمكن أن يتجنب الخلط بين «تذكر أسماء أدوات محددة» وبين قدرة تعميم حقيقية.

يرفع AgentCanary من شدة الهجوم بشكل أكبر. يقوم المهاجم بتعديل التعليمات باستمرار بناءً على الاستجابة الفعلية للوكيل في الجولة السابقة، محاولًا إيجاد طرق جديدة للالتفاف، وبالتالي فإن الاختبار لا يقتصر على فعالية الدفاع ضد مجموعة ثابتة من عينات الهجوم، بل على مقدار القدرة الأمنية التي يمكن أن يحتفظ بها حزام الأمان عند مواجهة مهاجمين متكيفين بنشاط.

EvoSafeHarness: تجميد النموذج المستهدف والتحسين المشترك لاستراتيجيات اللغة الطبيعية والكود القابل للتنفيذ

لا يقوم EvoSafeHarness بضبط أمان النموذج اللغوي الكبير المستهدف، وتبقى معلمات النموذج مجمدة طوال عملية البحث بأكملها. ما يتغير حقًا هو حزام الأمان بين المستخدم والنموذج والأدوات، أي منطق طبقة النظام الذي يتحكم في كيفية دخول المعلومات إلى النموذج، وكيفية تنفيذ استدعاءات الأدوات، وكيفية إرجاع النتائج.

يقسم البحث Harness إلى جزأين: سياسة اللغة الطبيعية والكود القابل للتنفيذ. تُستخدم سياسة اللغة الطبيعية بشكل أساسي لتوضيح المعلومات التي يمكن الوثوق بها، وكيفية التعامل مع المحتوى الخارجي، والحالات التي تتطلب الرفض؛ بينما يمكن للكود القابل للتنفيذ فحص استدعاءات الأدوات أو تعديلها أو حظرها مباشرة، مع تسجيل الإجراءات السابقة وتتبع تدفق البيانات، واستدعاء نموذج الحكم المساعد عند الحاجة. وبهذه الطريقة، يمكن ترجمة بعض القيود الأمنية مباشرة إلى مرحلة التنفيذ، دون الاعتماد كليًا على ما إذا كان النموذج قد تذكر المتطلبات الواردة في التوجيهات.

تتولى عملية البحث بأكملها التنفيذ بشكل تعاوني كل من Designer وCriticizer وCascade Test Environment وAnalyzer. يقرأ Designer المواصفات المجالية، وHarness الموجودة، والتقييمات التاريخية، ومسارات التنفيذ التي فشل فيها النموذج سابقًا، ثم يعدّل الخطة بناءً على ذلك. قد يكون التعديل قاعدة جديدة، أو يتعلق بطريقة تسجيل الحالة، أو موقع الفحص، أو دورة التحكم بأكملها.

يمكن أن يواجه البحث التلقائي مشكلة: قد يتعلم النظام عن غير قصد قواعد مخصصة لمجموعة الاختبار نفسها. على سبيل المثال، إذا تكرر ظهور اسم ملف خطر معين في نوع معين من الهجمات، فإن إضافة هذا الاسم مباشرة إلى القائمة السوداء يمكن أن يرفع النتيجة بسرعة، ولكن يمكن للمهاجم تجاوز ذلك بمجرد تغيير الاسم قليلاً. لتجنب هذا النوع من الإفراط في التكيف، أضاف البحث Criticizer مستقلًا. يحاول تعديل المسارات، أو نقل مواقع الملفات، أو إعادة صياغة تعليمات الهجوم، للتحقق مما إذا كانت القاعدة المرشحة لا تزال فعالة. إذا كان الدفاع يعتمد على سلسلة محددة بدلاً من علاقات مستقرة نسبيًا مثل «هل هذا الإجراء حصل على تفويض من المستخدم» أو «من أين جاءت هذه المعلومات»، فإن الخطة المرشحة تحتاج إلى مزيد من التعديل.

بعد اجتياز المراجعة، يدخل Harness إلى Cascade Test Environment. يبدأ الاختبار من التحقق من قدرة الكود على العمل بشكل طبيعي ومن عدد صغير من المهام، ثم يتوسع تدريجيًا؛ يتم إيقاف الخطط الواضح ضعفها مبكرًا لتجنب استهلاك موارد التقييم. يقوم Analyzer بتسجيل أداء المهام العادية والهجمات المباشرة والهجمات غير المباشرة بشكل منفصل، مع حفظ مسارات الفشل المحددة، ثم يعيدها إلى Designer لإجراء جولة التعديل التالية.

*عملية البحث الشاملة لـ EvoSafeHarness*

عند التقييم، لم يقتصر البحث على معدل نجاح الهجوم فقط. وإلا لكان الحل الأمني الأبسط هو رفض جميع العمليات، وعندها لا يمكن للهجمات النجاح فعلًا، لكن الوكيل يفقد قيمته الاستخدامية. لذلك يفحص EvoSafeHarness في الوقت نفسه إنجاز المهام العادية ونجاح الهجمات، ولا يحصل الحل المرشح على تقييم أعلى إلا إذا خفض معدل نجاح الهجمات مع الحفاظ أساسًا على القدرة على أداء المهام.

البحث أيضًا لا يبدأ من فراغ تمامًا. استخلص البحث بعض الخبرات الأساسية من الأساليب الأمنية الموجودة، مثل أن مخرجات الأدوات تعتبر افتراضيًا بيانات غير موثوقة، ويجب التحقق قبل تنفيذ الإجراء من مطابقته لطلب المستخدم الأصلي. لكن هذه الخبرات تُستخدم فقط كنقطة انطلاق، ويمكن للبحث اللاحق الاحتفاظ بها أو إعادة تنظيمها أو حذفها. بعض Harness النهائية لا تزال تعتمد بشكل أساسي على سياسات اللغة الطبيعية، وبعضها يعتمد أكثر على القواعد البرمجية، وبعضها الآخر يضيف تسجيل الحالة عبر الخطوات وتتبع تدفق البيانات.

هنا يمكن أيضًا رؤية الفكرة الأساسية لهذا العمل: الهياكل المخاطر التي تواجهها أنظمة الملفات والقطاع المالي والاتصالات ليست متطابقة، كما تؤثر العادات السلوكية للنموذج نفسه على طريقة الدفاع. يحتاج نظام الملفات إلى فحص الأوامر والمسارات وتدفقات البيانات الحساسة، بينما يهتم السيناريو المالي أكثر باتجاه المعاملات وتدفق الأموال والعلاقات بين العمليات المتعددة. بالنسبة للنماذج تحديدًا، بعض النماذج تكرر المحاولة بعد الرفض، وبعضها يبحث عن مسارات بديلة، وبعضها يطلق استدعاءات متزامنة متعددة في وقت واحد، ولذلك يحتاج Harness إلى تعديلات مختلفة.

*مقارنة بين Harness الأمني الثابت و EvoSafeHarness*

بأخذ نظام ملفات OS كمثال، عند مواجهة نفس تعليمات نسخ الملفات الخبيثة، يحتاج Sonnet 4.6 فقط إلى تذكير بالمصدر وفحوصات دلالية قليلة؛ بينما يحتاج GLM-5 إلى إضافة فحوصات للأوامر الخطرة والمواقع الحساسة والمعلومات السرية وتدفق البيانات. إذا ثبت استخدام GLM-5 وتم التحول إلى السيناريو المالي، فإن Harness سيتحول بدوره إلى فحص تدفق الأموال الخارجة، والمستفيدين، والمعاملات التاريخية، لأن المخاطر قد تأتي من عمليات متعددة تبدو طبيعية كل على حدة، لكنها تشكل مشكلة عند دمجها.

14 من أصل 15 توليفة «نموذج × مجال» حققت أفضل أداء

اختبر الباحثون أولاً على DTAP النماذج الخمسة Sonnet 4.6 وGLM-5 وKimi-K2.5 وQwen3.7-plus وDeepSeek-V4-Flash، وبحثوا عن Harness في المجالات الثلاثة: نظام ملفات OS والقطاع المالي والاتصالات، ليشكلوا إجمالي 15 توليفة «نموذج × مجال».

بدون دفاع، أظهرت النماذج الخمسة بالفعل فروقًا أمنية كبيرة. متوسط معدل نجاح الهجوم (ASR) لـ Sonnet 4.6 هو 4.8% فقط، بينما يصل DeepSeek-V4-Flash إلى 71.0%. يتأثر تأثير الدفاع الثابت أيضًا بالمجال؛ فـ CaMeL وDRIFT كان أداؤهما جيدًا نسبيًا في نظام الملفات، لكن قدرتهما الدفاعية تراجعت بشكل ملحوظ في السيناريوهات المالية والاتصالات.

حقق EvoSafeHarness أعلى درجة مركّبة في 14 من أصل 15 مجموعة. انخفض متوسط معدل نجاح الهجوم من 45.6% عند عدم وجود دفاع إلى 10.0%، بينما انخفضت فائدة المهام العادية بمقدار 3.3 نقاط مئوية فقط. وعلى سبيل المقارنة، لا يزال متوسط معدل نجاح الهجوم لكل من CaMeL وDRIFT عند 37.7% و42.4% على التوالي؛ ويمكن لـ Progent خفض معدل نجاح الهجوم إلى 10.5%، لكن فائدة المهام العادية تنخفض أيضًا إلى 56.4%، بينما تبلغ 79.8% لدى EvoSafeHarness. وبالنظر إلى نوعي الهجمات بشكل منفصل، انخفض معدل نجاح الهجمات المباشرة من 50.9% إلى 12.6%، بينما انخفض معدل نجاح الهجمات غير المباشرة من 40.4% إلى 7.4%.

*أداء EvoSafeHarness من حيث الأمان والفائدة على 4 فئات من معايير السلامة*

تتوافق هذه النتائج مع الاختلافات بين النماذج المذكورة سابقًا. عند مواجهة نفس هجمات نظام الملفات، يمكن لـ Sonnet 4.6 تحقيق معدل نجاح هجوم أقل باستخدام أحكام دلالية أخف وزنًا، بينما يحتاج GLM-5 إلى مزيد من الفحوصات الحتمية وتتبع الحالة. وعند تغيّر المجال، يتغير أيضًا موضوع الحكم الأمني: ففي نظام الملفات، يتم التحقق أساسًا مما إذا كان الإجراء الواحد يمس أوامر خطيرة أو بيانات حساسة، بينما في السيناريو المالي، يجب أيضًا الأخذ في الاعتبار سجل المعاملات السابقة لتحديد ما إذا كانت الإجراءات المتعددة المتتالية تشكل غسيلًا للصفقات أو سحبًا للأموال.

على منصة Agent-SafetyBench، واصلت الدراسة اختبار المشكلات الأمنية التي لا تظهر بالضرورة من خلال استدعاء الأدوات. في المتوسط عبر النماذج الثلاثة، بلغ معدل السلوك غير الآمن لدى EvoSafeHarness 12.3%، ومعدل نجاح الهجوم 7.4%، وفائدة المهام في بيئة الهجوم 63.4%. وتشير النتائج إلى أن تحسين المؤشرات الأمنية لم يصاحبه رفض واسع النطاق للمهام العادية.

أما تجارب النقل، فاختبرت بشكل أكثر مباشرة ما إذا كان Harness يعتمد على الأدوات التي شوهدت أثناء التدريب. بحث EvoSafeHarness فقط على AgentDojo، وحقق فيه فائدة بنسبة 82.8% ومعدل نجاح هجوم 0%؛ ثم طُبّق نفس Harness مباشرة على AgentDyn، وحافظ على فائدة بنسبة 75.0% ومعدل نجاح هجوم 0%. كما حقق CaMeL معدل نجاح هجوم 0% على AgentDyn، لكن فائدة المهام العادية انخفضت في الوقت نفسه إلى 0%، مما يوضح أن اعتراض جميع المخاطر معًا ليس بالأمر الصعب، بل الصعوبة تكمن في مواصلة تمكين الوكيل من إكمال العمل الطبيعي مع صد الهجمات.

في الهجمات التكيفية على AgentCanary، انخفض معدل نجاح الهجوم من 23.6% إلى 9.7% في ظل ظروف الهجوم الثابتة. ومع استمرار المهاجم في تعديل المطالبات بناءً على ملاحظات النظام، عاد معدل نجاح الهجوم إلى الارتفاع؛ وعند السماح بما يصل إلى 16 جولة من التعديلات، بلغ متوسط معدل نجاح الهجوم عبر أدوات الهجوم الثلاث 19.5%. ورغم أن بعض الهجمات وجدت طرقًا جديدة للالتفاف، إلا أن الدفاع لم يفشل بسرعة بسبب تغيّر صياغة الهجوم.

*استهلاك الموارد في الطبقتين لدى EvoSafeHarness*

أخيرًا، أجرت الدراسة اختبارات إحصائية على 1,050 مهمة هجوم مقترنة في DTAP. من بين 15 مجموعة نموذج-مجال، انخفض معدل نجاح الهجوم بشكل ملحوظ في 13 منها، بينما كانت النماذج في المجموعتين الأخريين قادرة أصلًا على صد الغالبية العظمى من الهجمات. وفي جميع المهام، منع EvoSafeHarness 385 هجومًا كان سينجح في الأصل، وأضاف 11 حالة نجاح هجوم فقط، وتدعم النتائج الإحصائية أن هذا التغيير ليس مجرد تقلبات عشوائية.

وفي الوقت نفسه، تداخلت فترات الثقة لفائدة المهام العادية في المجموعات الخمس عشرة مع حالة عدم وجود دفاع. بعبارة أخرى، لم يتحقق التحسن الأمني الذي لاحظته الورقة من خلال إضعاف واسع النطاق لقدرات المهام العادية. وبالنسبة للوكلاء الذين يحتاجون فعلًا إلى الدخول إلى بيئات واقعية، فإن هذه النقطة أكثر أهمية من مجرد السعي إلى انخفاض معدل نجاح الهجوم.

الخاتمة

يقدم EvoSafeHarness نهجًا مختلفًا عن فكرة «الحارس الموحّد»: فبعد دخول الوكيل إلى بيئة أعمال محددة، يمكن إعادة تصميم القيود الأمنية بناءً على سلوك النموذج ومخاطر المجال، بدلًا من تطبيق نفس القواعد على جميع الأنظمة. كما تُظهر الدراسة أن العامل الحاسم في فعالية الدفاع ليس غالبًا عدد القواعد، بل ما إذا كانت القواعد تتوافق مع المخاطر الفعلية، وما إذا كانت الفحوصات موضوعة في الأماكن المناسبة، وما إذا كان النظام يحتفظ بسياق حالة كافٍ.

بطبيعة الحال، لهذه الطريقة حدود أيضًا؛ فبالنسبة للمخاطر التي تحدث أساسًا على مستوى المحتوى، مثل الأخطاء الواقعية والتعبيرات المضللة، إذا لم تكن هناك إجراءات أو صلاحيات أو علاقات حالة يمكن فحصها مباشرة، فقد يصعب على Harness على مستوى النظام حلها بالكامل. ومع زيادة دمج الوكلاء في أنظمة الأعمال الحقيقية، قد يصبح كيفية تنسيق القدرات الأمنية الذاتية للنموذج والقواعد المجالية والقيود على مستوى التنفيذ معًا، قضية تستحق مزيدًا من البحث المستمر.