HyperAIHyperAI

Command Palette

Search for a command to run...

CantTalkAboutThis Topic Control Dataset 话题控制数据集

日期

数据集组织

英伟达

论文 URL

2404.03820

许可证

CC BY 4.0

数据集概述

CantTalkAboutThis Topic Control Dataset 是由 NVIDIA 于 2024 年发布的一个用于训练语言模型在任务导向对话中保持话题焦点的数据集,相关论文成果为「CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues」,旨在提升模型对干扰项的抵抗力并增强指令遵循和安全任务的对齐能力。

该数据集包含 1080 个合成对话,涵盖健康、银行、旅行、教育、金融、保险、法律、房地产和电脑故障排除等九个领域。 每个对话都包含干扰项,用于测试和改善模型在处理无关话题时的表现。 该数据集不含个人敏感信息,由合成数据生成。

数据集组成

数据集包含以下字段:

  • domain:对话所属的领域
  • scenario:正在讨论的具体场景或任务
  • system_instruction:给模型的对话策略,通常是一组关于允许和不允许话题的复杂指令
  • conversation:完整对话,包括主话题和干扰项
  • distractors:干扰项列表,包括对话中的机器人回复和用户应作为对机器人回复的响应包含的干扰项
  • conversation_with_distractors:包含干扰项的对话

数据集分为两个子集:训练集(mixtral)和测试集(human_test_set)。训练集基于 Mixtral-8x7B-Instruct 模型生成,测试集包含人工标注的更复杂、更真实的干扰项,用于评估模型性能。

Citation

@inproceedings{sreedhar2024canttalkaboutthis,
  title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
  author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
  booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
  pages={12232--12252},
  year={2024},
  organization={Association for Computational Linguistics}
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供