HyperAI
Command Palette
Search for a command to run...
CantTalkAboutThis Topic Control Dataset - Non Commercial 话题控制数据集
数据集概述
CantTalkAboutThis Topic Control Dataset - Non Commercial 是由 NVIDIA 于 2024 年发布的一个专注于对话话题控制与语言模型安全对齐的数据集,相关论文成果为「CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues」,旨在提升大语言模型在任务导向对话中保持话题聚焦的能力并增强其对干扰项的鲁棒性。
该数据集包含 1080 个合成对话样本,涵盖健康、银行、旅行、教育、金融、保险、法律、房地产和计算机故障排除等九个领域,每个对话均包含用于测试模型话题偏离抵抗能力的干扰轮次。 通过在该数据集上进行微调,可以显著增强模型在遵循指令和安全任务中的表现,使其能够有效识别敏感话题并处理受限内容。
数据集组成
数据集主要包含以下字段:
- domain:对话所属的领域
- scenario:正在讨论的具体场景或任务
- system_instruction:赋予模型的对流策略,通常包含允许和禁止讨论的复杂指令集
- conversation:完整的对话内容,包括主要话题和干扰轮次
- distractors:干扰轮次列表,包含对话中的机器人轮次以及用户应作为对机器人轮次响应的干扰轮次
- conversation_with_distractors:包含干扰轮次的完整对话
数据集分为训练集和测试集,其中训练集由 GPT-4 Turbo 模型合成生成,测试集为人工标注的评估数据集,包含更复杂、更真实的干扰项,用于评估模型性能。
Citation
@inproceedings{sreedhar2024canttalkaboutthis,
title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
pages={12232--12252},
year={2024},
organization={Association for Computational Linguistics}
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。