HyperAIHyperAI

Command Palette

Search for a command to run...

CantTalkAboutThis Contrôle De Sujet

Date

Organisation

NVIDIA

URL du document

2404.03820

Licence

CC BY 4.0

Aperçu du jeu de données

Le Dataset Contrôle CantTalkAboutThisTopic est un ensemble de données publié par NVIDIA en 2024 pour entraîner les modèles linguistiques à maintenir le focus sur le sujet dans des dialogues orientés vers une tâche. Les résultats associés sont publiés sous forme d'article scientifique : « CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues ». L’objectif principal est d’améliorer la résistance des modèles aux éléments perturbateurs et de renforcer l’alignement avec les instructions ainsi que les capacités liées à la sécurité lors de tâches spécifiques.

Ce jeu de données comprend 1080 conversations synthétiques couvrant neuf domaines : santé, banque, voyage, éducation, finance, assurance, droit, immobilier et dépannage informatique.
Chaque dialogue contient des éléments perturbateurs conçus pour tester et améliorer la performance du modèle lorsqu’il traite hors-sujet.
Aucune information personnelle sensible n’est présente ; toutes les données ont été générées artificiellement.

Composition du jeu de données

Les champs inclus dans ce jeu de données sont les suivants :

  • domain : domaine auquel appartient la conversation
  • scenario : scénario ou tâche spécifique discutée
  • system_instruction : stratégie de dialogue fournie au modèle, généralement composée d'instructions complexes définissant quels sujets sont autorisés ou interdits
  • conversation : dialogue complet incluant le sujet principal et les éléments perturbateurs
  • distractors : liste des éléments perturbateurs, comprenant les réponses du bot et celles attendues de l'utilisateur comme réponse aux interventions du bot
  • conversation_with_distractors : version complète du dialogue intégrant tous les éléments perturbateurs

Le jeu de données se divise en deux sous-ensembles : un ensemble d'apprentissage (mixtral) et un ensemble de test (human_test_set). L'ensemble d'apprentissage a été généré à partir du modèle Mixtral-8x7B-Instruct tandis que l'ensemble de test comporte des éléments perturbateurs plus complexes et réalistes annotés manuellement afin d'évaluer précisément les performances du modèle.

Référence bibliographique

@inproceedings{sreedhar2024canttalkaboutthis,
  title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
  author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
  booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
  pages={12232--12252},
  year={2024},
  organization={Association for Computational Linguistics}
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp