Command Palette
Search for a command to run...
Planification De Calendrier
Date
Licence
CC BY 4.0
Aperçu du jeu de données
Le Dataset Calendar Scheduling est un ensemble de données de conversations multi-tours publié par NVIDIA en 2025, conçu pour comprendre les contraintes d’ordonnancement exprimées en langage naturel et suivre des instructions sur plusieurs tours afin de résoudre les conflits.
Cet ensemble de données contient des données de conversations multi-tours générées via une méthode synthétique, destinées à entraîner les grands modèles de langage (LLM) à planifier des événements dans le respect de contraintes complexes.
Le processus de génération des données repose sur des personnalités prédéfinies attribuées aux rôles, simulant des utilisateurs qui soumettent aléatoirement des demandes d’événements incluant des contraintes de durée et de créneaux horaires ; l’assistant doit alors intégrer toutes ces contraintes pour finaliser la planification.
Publié dans le cadre du framework NVIDIA NeMo Gym, cet ensemble vise à soutenir la construction d’environnements d’apprentissage par renforcement avec récompenses vérifiables (RLVR), aidant ainsi la communauté à améliorer la capacité des modèles à respecter les instructions sur plusieurs tours.
Composition du jeu de données
L’ensemble de données comprend principalement les champs et structures suivants :
conversation: Enregistrement de la conversation multi-tour, contenant l’interaction entre l’utilisateur et l’assistant, se terminant par le dernier message de l’utilisateur.exp_cal_state: Dictionnaire listant les événements du calendrier associés à leurs durées et contraintes correspondantes, permettant de vérifier l’exactitude des résultats de planification.
L’ensemble de données est divisé en deux sous-ensembles : un ensemble d’entraînement (train) et un ensemble de validation (validation), totalisant 4 000 échantillons. La répartition spécifique est la suivante :
- Ensemble d’entraînement (
train) : 3 872 exemples - Ensemble de validation (
validation) : 128 exemples
Les données sont stockées au format texte, occupant environ 43 Mo au total.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.