HyperAIHyperAI

Command Palette

Search for a command to run...

CantTalkAboutThis トピック制御 - 非商用

日付

データセット構成

NVIDIA

Paper URL

2404.03820

ライセンス

CC BY 4.0

データセット概要

CantTalkAboutThis Topic Control Dataset - Non Commercial は、NVIDIA が 2024年に公開した、対話トピック制御と言語モデルの安全性アライメントに焦点を当てたデータセットです。関連論文は「CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues」で発表されており、タスク指向対話において大規模言語モデル(LLM)が話題への集中力を維持する能力を向上させ、ノイズに対する堅牢性を高めることを目的としています。

このデータセットには 1080 の合成会話サンプルが含まれており、ヘルスケア、銀行、旅行、教育、金融、保険、法務、不動産、コンピュータトラブルシューティングという9つの領域をカバーしています。各会話には、モデルの話題逸脱耐性をテストするためのディストレータターン(妨害ターン)が含まれています。 本データセットでのファインチューニングにより、指示遵守やセキュリティタスクにおけるモデルのパフォーマンスが大幅に向上し、機密性の高い話題の識別や制限されたコンテンツの処理が可能になります。

データセット構成

データセットは主に以下のフィールドで構成されています:

  • domain:会話が属するドメイン
  • scenario:議論されている具体的なシナリオまたはタスク
  • system_instruction:モデルに付与されるコンバッションポリシー。一般的に、許可および拒否すべき複雑な指示セットを含みます
  • conversation:主要な話題と妨害ターンを含む完全な会話内容
  • distractors:妨害ターンのリスト。会話内のボットターンと、ユーザーがボットの応答として行うべき妨害ターンを含みます
  • conversation_with_distractors:妨害ターンを含む完全な会話

データセットはトレーニングセットとテストセットに分かれています。トレーニングセットは GPT-4 Turbo モデルによって合成生成され、テストセットは人間の注釈による評価用データセットであり、より複雑で現実的な妨害項を含み、モデルパフォーマンスの評価に使用されます。

引用

@inproceedings{sreedhar2024canttalkaboutthis,
  title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
  author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
  booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
  pages={12232--12252},
  year={2024},
  organization={Association for Computational Linguistics}
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています