Command Palette
Search for a command to run...
Nemotron-3-Nano-RL-Training-Blend Reinforcement-Learning-Trainingsdatensatz
Nemotron-3-Nano-RL-Training-Blend ist ein von NVIDIA im Jahr 2025 veröffentlichter kuratierter Datensatz zum Training des Nemotron-3-Nano-30B-A3B-Modells. Er enthält 93.244 Stichproben mit einer Gesamtspeichergröße von 6,92 GB und zeichnet sich durch einen moderaten Datenumfang sowie eine sorgfältige Mischung und Vorverarbeitung aus. Er setzt sich aus mehreren Unterdatensätzen in festgelegten Anteilen zusammen, darunter Aufgaben wie Befolgung von Anweisungen, Wissensfragen, Arbeitsplatzassistent, strukturierte Ausgaben, wettbewerbsorientiertes Programmieren und mathematisches Denken. Ziel ist es, die Leistung großer Sprachmodelle mithilfe des Reinforcement-Learning-from-Verifiable-Rewards (RLVR)-Frameworks zu verbessern.
Die Datenstichproben sind in einer aufsteigenden Reihenfolge von leicht nach schwer im Sinne eines Curriculum-Lernens angeordnet, um einen ausgewogenen Lernfortschritt zu gewährleisten. Sie sind speziell für die Post-Training-Phase des NeMo-Gym-Frameworks konzipiert und unterstützen die kommerzielle Nutzung.
Zusammensetzung des Datensatzes
Dieser Datensatz ist ein Mischdatensatz, der aus den folgenden Komponenten-Datensätzen in den angegebenen Anteilen gemischt wird:
- nvidia/Nemotron-RL-instruction_following (0,17)
- nvidia/Nemotron-RL-knowledge-mcqa (0,20)
- nvidia/Nemotron-RL-agent-workplace_assistant (0,10)
- nvidia/Nemotron-RL-instruction_following-structured_outputs (0,05)
- nvidia/Nemotron-RL-coding-competitive_coding (0,25)
- BytedTsinghua-SIA/DAPO-Math-17k (0,10)
- Skywork/Skywork-OR1-RL-Data (ohne OmniMath) (0,12)
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.