Command Palette
Search for a command to run...
Nemotron-3-Super-RL-Training-Blends : Jeu De Données De Mélange D'entraînement super-apprentissage Par Renforcement
Nemotron-3-Super-RL-Training-Blends est un ensemble de données mixtes d'apprentissage par renforcement publié par NVIDIA en 2026, utilisé pour entraîner le modèle Nemotron-3-Super-120B-A12B. Il contient 479 303 échantillons, pour une taille totale d'environ 26,3 Go, avec des données au format JSONL, conçu pour fournir des données dosées et prétraitées pour l'apprentissage par renforcement à partir de récompenses vérifiables (RLVR) et le post-entraînement des grands modèles de langage.
Composition de l'ensemble de données
-
RLVR 1 : contient des données de tâches variées telles que le raisonnement mathématique, l'utilisation d'outils, les compétitions de codage, le suivi d'instructions et la sécurité, pour un total de 138 712 échantillons.
-
RLVR 2 : ajuste les proportions du mélange de différentes sources de données par rapport à RLVR 1, pour un total de 156 278 échantillons.
-
RLVR 3 : ajuste davantage les proportions des données, en ajoutant des données liées aux capacités d'agent, aux appels de fonction et à l'apprentissage par renforcement, pour un total de 107 037 échantillons.
-
SWE 1 : principalement composé de R2E-Gym-Subset (79,70 %) et de SWE-Gym (20,30 %), pour un total de 50 661 échantillons.
-
SWE 2 : principalement composé de R2E-Gym-Subset (81,18 %) et de SWE-Gym (18,82 %), pour un total de 1 444 échantillons.
-
RLHF : principalement composé de Nemotron-RLHF-GenRM-v1 (77,00 %), Nemotron-RL-Agentic-Conversational-Tool-Use-v1 (20,00 %) et Nemotron-RL-Identity-Following-v1 (3,00 %), pour un total de 25 171 échantillons.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.