Command Palette
Search for a command to run...
Nemotron-RL-Agentic-Terminal-Pivot-v1 Ensemble De Données D'apprentissage Par Renforcement Pour Agents Terminaux
Nemotron-RL-Agentic-Terminal-Pivot-v1 est un jeu de données d'apprentissage par renforcement pour agents terminaux publié par NVIDIA en 2026, conçu pour fournir des échantillons d'entraînement en apprentissage par renforcement aux grands modèles de langage dans les scénarios d'interaction avec le terminal (ligne de commande). Ce jeu de données est spécialement conçu pour l'environnement terminus_judge de NeMo Gym et peut être utilisé pour le post-entraînement par renforcement, la finesse ajustée supervisée ou l'analyse hors ligne du comportement des agents.
Le jeu de données contient 31 111 exemples d’entraînement, issus de 630 tâches semelles ATCB et de 2 716 trajectoires sources différentes. Les scénarios couvrent des opérations prolongées sur terminal dans divers domaines tels que les systèmes industriels, les clusters HPC, la santé, la finance et l'archivage multimédia, incluant notamment la construction de pipelines de données, l'audit des pannes, le diagnostic de services ainsi que les processus de conformité sécuritaire. La médiane des exemples associés à chaque tâche s'établit à 45. Chaque exemple correspond à un point décisionnel unique extrait des trajectoires d’un agent ayant accompli avec succès sa tâche finale ; il comprend une invite de tâche, une action de référence indiquant l’étape suivante générée par l’agent Terminus-2 dont le modèle professeur est GLM‑5.1, ainsi qu’une information routière destinée au calcul du score de récompense. En moyenne, les invites comportent environ 39 900 caractères tandis que les actions de référence représentent près de 970 caractères.
Champs de données :
- responses_create_params.input : Invite contenant les instructions de la tâche ainsi que l'historique des interactions jusqu'au point de décision
- expected_answer : Action de référence correspondant à l'étape suivante prévue pour l'agent à ce stade
- agent_ref : Informations de routage vers le serveur de ressources NeMo Gym terminus_judge, utilisées pour évaluer les actions du modèle politique et générer les récompenses issues de l’apprentissage par renforcement
- metadata : Objet métadonnées comprenant cinq sous-champs, où ont été supprimés les identifiants internes liés à la collecte ainsi que les informations relatives à l'infrastructure
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.