Command Palette
Search for a command to run...
Nemotron-3-Super-RL-Training-Blends スーパー強化学習トレーニング混合データセット
Nemotron-3-Super-RL-Training-Blends は、NVIDIA が 2026 年に公開した強化学習トレーニング用データ混合セットで、Nemotron-3-Super-120B-A12B モデルのトレーニングに使用され、479,303 件のサンプル、総規模約 26.3 GB、データ形式は JSONL であり、大規模言語モデルの強化学習(検証可能な報酬を用いた RLVR)および後続トレーニング向けに、比率調整と前処理が施されたデータを提供することを目的としています。
データセット構成
-
RLVR 1:数学推論、ツール使用、コードコンペティション、指示追従、安全性など、さまざまなタスクデータを含み、合計 138,712 件のサンプルで構成されています。
-
RLVR 2:RLVR 1 を基に、異なるデータソースの混合比率を調整したもので、合計 156,278 件のサンプルで構成されています。
-
RLVR 3:データ比率をさらに調整し、エージェント能力、関数呼び出し、強化学習関連データを追加したもので、合計 107,037 件のサンプルで構成されています。
-
SWE 1:主に R2E-Gym-Subset(79.70%)と SWE-Gym(20.30%)で構成され、合計 50,661 件のサンプルで構成されています。
-
SWE 2:主に R2E-Gym-Subset(81.18%)と SWE-Gym(18.82%)で構成され、合計 1,444 件のサンプルで構成されています。
-
RLHF:主に Nemotron-RLHF-GenRM-v1(77.00%)、Nemotron-RL-Agentic-Conversational-Tool-Use-v1(20.00%)、Nemotron-RL-Identity-Following-v1(3.00%)で構成され、合計 25,171 件のサンプルで構成されています。