HyperAIHyperAI

Command Palette

Search for a command to run...

لا يمكنني التحدث عن هذا مجموعة بيانات التحكم في الموضوعات

التاريخ

المؤسسة

NVIDIA

رابط الورقة البحثية

2404.03820

الترخيص

CC BY NC 4.0

موضوع CantTalkAboutThis هو مجموعة بيانات تم إصدارها بواسطة شركة إنفيديا في عام 2024، وتركز على التحكم في موضوعات المحادثات ومواءمة نماذج اللغة من منظور الأمان. النتائج البحثية ذات الصلة منشورة في «CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues»، وتهدف إلى تعزيز قدرة النماذج اللغوية الكبيرة على الحفاظ على تركيز الموضوع أثناء الحوارات الموجهة نحو المهام، وزيادة متانتها تجاه المشتتات.

تحتوي هذه المجموعة البيانات على 1,080 عينة حوار اصطناعية، تغطي تسعة مجالات هي الصحة والخدمات المصرفية والسفر والتعليم والمالية والتأمين والقانون والعقارات واستكشاف أخطاء أجهزة الكمبيوتر وإصلاحها. يتضمن كل حوار جولات مشتّتة مصمّمة لاختبار مقاومة النموذج للانحراف عن الموضوع الأساسي.

من خلال ضبط النموذج باستخدام هذا المجموع البيانات، يمكن تحسين أدائه بشكل ملحوظ في اتباع التعليمات وتنفيذ مهام الأمن، مما يمكّنه من التعرف الفعّال على المواضيع الحساسة والتعامل مع المحتويات المقيدة.

مكونات مجموعة البيانات

تتضمن مجموعة البيانات الحقول التالية أساسًا:

  • domain: المجال الذي ينتمي إليه الحوار.
  • scenario: المشهد أو المهمة المحددة التي يتم مناقشتها حاليًا.
  • system_instruction: استراتيجية توجيه النظام المُعطاة للنموذج، وغالباً ما تتضمن مجموعة تعليمات معقدة تحدد ما يُسمح وما لا يُسمَح بمناقشته.
  • conversation: محتوى الحوار الكامل، بما في ذلك الموضوع الرئيسي وجولات المشتتات.
  • distractors: قائمة بجولات المشتتات، وتشمل الجولات الخاصة بالروبوت بالإضافة إلى جولة المستخدم التي يجب أن تكون رداً على دور الروبوت كمشتت.
  • conversation_with_distractors: الحوار الكامل المتضمّن لجولات المشتتات.

تنقسم مجموعة البيانات إلى جزء للتدريب وجزء للاختبار؛ حيث تم توليد الجزء الخاص بالتدريب الاصطناعي باستخدام نموذج GPT-4 Turbo، بينما يعتبر الاختبار مجموعة تقييم مُعلَّمة يدوياً تحتوي على مشتتات أكثر تعقيداً واقعية لتقييم أداء النموذج بدقة.

الاستشهاد المرجعي

@inproceedings{sreedhar2024canttalkaboutthis,
  title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
  author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
  booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
  pages={12232--12252},
  year={2024},
  organization={Association for Computational Linguistics}
}

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp