Command Palette
Search for a command to run...
Nemotron-3-Nano-RL-Training-Blend Jeu De Données D'entraînement Par Apprentissage Par Renforcement
Nemotron-3-Nano-RL-Training-Blend est un ensemble de données sélectionné publié par NVIDIA en 2025 pour entraîner le modèle Nemotron-3-Nano-30B-A3B, contenant 93 244 échantillons pour un stockage total de 6,92 Go, avec une taille de données modérée et soigneusement mélangée et prétraitée. Il est composé de plusieurs sous-ensembles de données mélangés selon des proportions, incluant des tâches telles que le suivi d'instructions, les questions-réponses de connaissances, l'assistant de bureau, la sortie structurée, la programmation compétitive et le raisonnement mathématique. Il vise à améliorer les performances des grands modèles de langage grâce au cadre d'apprentissage par renforcement avec récompenses vérifiables (RLVR).
Les échantillons de données sont organisés selon un ordre d'apprentissage par curriculum allant du plus facile au plus difficile, afin de garantir une progression d'apprentissage équilibrée, spécifiquement conçus pour la phase de post-entraînement du framework NeMo Gym, avec prise en charge d'une utilisation commerciale.
Composition de l'ensemble de données
Cet ensemble de données est un ensemble hybride composé des sous-ensembles de données suivants mélangés selon les proportions indiquées :
- nvidia/Nemotron-RL-instruction_following (0,17)
- nvidia/Nemotron-RL-knowledge-mcqa (0,20)
- nvidia/Nemotron-RL-agent-workplace_assistant (0,10)
- nvidia/Nemotron-RL-instruction_following-structured_outputs (0,05)
- nvidia/Nemotron-RL-coding-competitive_coding (0,25)
- BytedTsinghua-SIA/DAPO-Math-17k (0,10)
- Skywork/Skywork-OR1-RL-Data (hors OmniMath) (0,12)
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.