Command Palette
Search for a command to run...
CantTalkAboutThis Themenkontrolle
Übersicht des Datensatzes
Der CantTalkAboutThis Topic Control Dataset wurde von NVIDIA im Jahr 2024 veröffentlicht und dient zum Training von Sprachmodellen darin, den Fokus auf das Thema in aufgabenorientierten Dialogen beizubehalten. Die zugehörige wissenschaftliche Arbeit ist unter „CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues“ verfügbar. Ziel ist es, die Robustheit der Modelle gegenüber Ablenkungen zu erhöhen sowie die Befolgung von Anweisungen und die Ausrichtung auf Sicherheitsaufgaben zu verbessern.
Dieser Datensatz umfasst 1.080 synthetische Dialoge aus neun Bereichen: Gesundheit, Bankenwesen, Reisen, Bildung, Finanzen, Versicherungswesen, Recht, Immobilien und Computerfehlerbehebung. Jeder Dialog enthält Ablenkungen, um die Leistung der Modelle beim Umgang mit irrelevanten Themen zu testen und zu verbessern. Der Datensatz enthält keine persönlichen sensiblen Daten; er wird ausschließlich durch synthetisch generierte Daten erstellt.
Zusammensetzung des Datensatzes
Der Datensatz beinhaltet folgende Felder:
- domain: Das Fachgebiet oder die Domäne, zu der der Dialog gehört
- scenario: Der spezifische Diskussionsgegenstand oder die Aufgabe innerhalb des Dialogs
- system_instruction: Eine dialogbezogene Strategie für das Modell, meist eine Reihe komplexer Vorgaben darüber, welche Themen erlaubt sind und welche nicht
- conversation: Der vollständige Dialog einschließlich Hauptthema und Ablenkungen
- distractors: Liste der Ablenkungen, bestehend aus Bot-Antworten im Dialog sowie vom Benutzer hinzuzufügenden Antworten als Reaktion auf diese Bot-Antworten
- conversation_with_distractors: Der gesamte Dialog inklusive der eingefügten Ablenkungen
Der Datensatz gliedert sich in zwei Teilmengen: einen Trainingsdatensatz („Mixtral“) und einen Testdatensatz („Human_Test_Set“). Der Trainingsdatensatz basiert auf dem Mixtral-8x7B-Instruct-Modell zur Generierung der Inhalte. Im Testdatensatz finden sich manuell annotierte, anspruchsvollere und realistischere Ablenkungen, die dazu dienen, die Leistungsfähigkeit der Modelle zu bewerten.
Zitation
@inproceedings{sreedhar2024canttalkaboutthis,
title={CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues},
author={Sreedhar, Makesh and Rebedea, Traian and Ghosh, Shaona and Zeng, Jiaqi and Parisien, Christopher},
booktitle={Findings of the Association for Computational Linguistics: EMNLP 2024},
pages={12232--12252},
year={2024},
organization={Association for Computational Linguistics}
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.