Command Palette
Search for a command to run...
التحكم في الموضوع CantTalkAboutThis
نظرة عامة على مجموعة البيانات
تم إصدار مجموعة بيانات "التحكم في موضوع CantTalkAboutThis" بواسطة شركة إنفيديا (NVIDIA) عام 2024، وهي مصممة لتدريب نماذج اللغات على الحفاظ على تركيز الموضوع أثناء المحادثات الموجهة نحو المهام. ترتبط النتائج البحثية ذات الصلة بـ «CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues»، وتهدف المجموعة إلى تعزيز مقاومة النماذج للعناصر المشتتة وزيادة قدرة الامتثال للتعليمات ومواءمة مهام الأمان.
تحتوي هذه المجموعة على 1080 محادثة مُولَّدة آلياً، تغطي تسعة مجالات هي: الصحة، والخدمات المصرفية، والسفر، والتعليم، والمالية، والتأمين، والقانون، والعقارات، واستكشاف أخطاء أجهزة الكمبيوتر وإصلاحها. تتضمن كل محادثة عناصر مشتتة تهدف إلى اختبار وتحسين أداء النموذج عند التعامل مع مواضيع غير ذات صلة. لا تحتوي هذه المجموعة على معلومات شخصية حساسة، حيث تم توليدها باستخدام بيانات تركيبية.
تكوين مجموعة البيانات
تشمل مجموعة البيانات الحقول التالية:
domain: المجال الذي تنتمي إليه المحادثة.scenario: المشهد أو المهمة المحددة التي تتم مناقشتها حالياً.system_instruction: استراتيجية الحوار المقدمة للنموذج، وتتكون عادةً من تعليمات معقدة تحدد المواضيع المسموح بها وغير المسموح بها.conversation: المحاكاة الكاملة للمحادثة، بما في ذلك الموضوع الرئيسي والعناصر المشتتة.distractors: قائمة بالعناصر المشتتة، وتشمل ردود الروبوت داخل المحادثة بالإضافة إلى العناصر التي يجب أن يدرجها المستخدم كاستجابة لردود الروبوت.conversation_with_distractors: المحادثة المتضمنة للعناصر المشتتة.
تنقسم مجموعة البيانات إلى مجموعتين فرعيتين: مجموعة التدريب (mixtral) ومجموعة الاختبار (human_test_set). تم إنشاء مجموعة التدريب بناءً على نموذج Mixtral-8x7B-Instruct، بينما تحتوي مجموعة الاختبار على عناصر مشتتة أكثر تعقيداً وواقعية من صنع بشري، وذلك لتقييم أداء النموذج.
الاستشهاد المرجعي
@inproceedings{sreedhar2024canttalkaboutthis,
title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
pages={12232--12252},
year={2024},
organization={Association for Computational Linguistics}
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.