HyperAI
Command Palette
Search for a command to run...
CantTalkAboutThis Topic Control Dataset 话题控制数据集
数据集概述
CantTalkAboutThis Topic Control Dataset 是由 NVIDIA 于 2024 年发布的一个用于训练语言模型在任务导向对话中保持话题焦点的数据集,相关论文成果为「CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues」,旨在提升模型对干扰项的抵抗力并增强指令遵循和安全任务的对齐能力。
该数据集包含 1080 个合成对话,涵盖健康、银行、旅行、教育、金融、保险、法律、房地产和电脑故障排除等九个领域。 每个对话都包含干扰项,用于测试和改善模型在处理无关话题时的表现。 该数据集不含个人敏感信息,由合成数据生成。
数据集组成
数据集包含以下字段:
- domain:对话所属的领域
- scenario:正在讨论的具体场景或任务
- system_instruction:给模型的对话策略,通常是一组关于允许和不允许话题的复杂指令
- conversation:完整对话,包括主话题和干扰项
- distractors:干扰项列表,包括对话中的机器人回复和用户应作为对机器人回复的响应包含的干扰项
- conversation_with_distractors:包含干扰项的对话
数据集分为两个子集:训练集(mixtral)和测试集(human_test_set)。训练集基于 Mixtral-8x7B-Instruct 模型生成,测试集包含人工标注的更复杂、更真实的干扰项,用于评估模型性能。
Citation
@inproceedings{sreedhar2024canttalkaboutthis,
title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
pages={12232--12252},
year={2024},
organization={Association for Computational Linguistics}
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。