HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-3-Super-RL-Training-Blends スーパー強化学習トレーニング混合データセット

日付

データセット構成

NVIDIA

ライセンス

CC BY 4.0

Nemotron-3-Super-RL-Training-Blends は、NVIDIA が 2026 年に公開した強化学習トレーニング用データ混合セットで、Nemotron-3-Super-120B-A12B モデルのトレーニングに使用され、479,303 件のサンプル、総規模約 26.3 GB、データ形式は JSONL であり、大規模言語モデルの強化学習(検証可能な報酬を用いた RLVR)および後続トレーニング向けに、比率調整と前処理が施されたデータを提供することを目的としています。

データセット構成

  • RLVR 1:数学推論、ツール使用、コードコンペティション、指示追従、安全性など、さまざまなタスクデータを含み、合計 138,712 件のサンプルで構成されています。

  • RLVR 2:RLVR 1 を基に、異なるデータソースの混合比率を調整したもので、合計 156,278 件のサンプルで構成されています。

  • RLVR 3:データ比率をさらに調整し、エージェント能力、関数呼び出し、強化学習関連データを追加したもので、合計 107,037 件のサンプルで構成されています。

  • SWE 1:主に R2E-Gym-Subset(79.70%)と SWE-Gym(20.30%)で構成され、合計 50,661 件のサンプルで構成されています。

  • SWE 2:主に R2E-Gym-Subset(81.18%)と SWE-Gym(18.82%)で構成され、合計 1,444 件のサンプルで構成されています。

  • RLHF:主に Nemotron-RLHF-GenRM-v1(77.00%)、Nemotron-RL-Agentic-Conversational-Tool-Use-v1(20.00%)、Nemotron-RL-Identity-Following-v1(3.00%)で構成され、合計 25,171 件のサンプルで構成されています。

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています