Command Palette
Search for a command to run...
Nemotron-3-Super-RL-Training-Blends Super-verstärkendes-Lernen-Trainingsmischdatensatz
Nemotron-3-Super-RL-Training-Blends ist ein von NVIDIA im Jahr 2026 veröffentlichter Datensatz-Mix für Reinforcement-Learning-Training, der zum Training des Modells Nemotron-3-Super-120B-A12B verwendet wird. Er enthält 479.303 Stichproben mit einem Gesamtumfang von etwa 26,3 GB. Die Daten liegen im JSONL-Format vor und zielen darauf ab, für das Reinforcement Learning from Verifiable Rewards (RLVR) und das Post-Training großer Sprachmodelle abgestimmte und vorverarbeitete Daten bereitzustellen.
Zusammensetzung des Datensatzes
-
RLVR 1: Enthält verschiedene Aufgabendaten wie mathematisches Denken, Tool-Nutzung, Code-Wettbewerbe, Anweisungsbefolgung und Sicherheit, insgesamt 138.712 Stichproben.
-
RLVR 2: Passt auf Basis von RLVR 1 die Mischungsverhältnisse verschiedener Datenquellen an, insgesamt 156.278 Stichproben.
-
RLVR 3: Passt die Datenzusammensetzung weiter an und erhöht den Anteil von Agentenfähigkeiten, Funktionsaufrufen und Reinforcement-Learning-bezogenen Daten, insgesamt 107.037 Stichproben.
-
SWE 1: Besteht hauptsächlich aus R2E-Gym-Subset (79,70 %) und SWE-Gym (20,30 %), insgesamt 50.661 Stichproben.
-
SWE 2: Besteht hauptsächlich aus R2E-Gym-Subset (81,18 %) und SWE-Gym (18,82 %), insgesamt 1.444 Stichproben.
-
RLHF: Besteht hauptsächlich aus Nemotron-RLHF-GenRM-v1 (77,00 %), Nemotron-RL-Agentic-Conversational-Tool-Use-v1 (20,00 %) und Nemotron-RL-Identity-Following-v1 (3,00 %), insgesamt 25.171 Stichproben.
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.