HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-3-Nano-RL-Training-Blend 強化学習トレーニングデータセット

日付

データセット構成

NVIDIA

ライセンス

Other

タグ

Nemotron-3-Nano-RL-Training-Blend は、NVIDIA が 2025 年に公開した、Nemotron-3-Nano-30B-A3B モデルのトレーニング用に設計された厳選データセットです。93,244 個のサンプル、総ストレージ容量 6.92 GB を含み、データ規模は適度で、慎重にブレンドおよび前処理されています。複数のサブデータセットを比率に応じてブレンドしたもので、命令追従、知識 Q&A、職場アシスタント、構造化出力、競技プログラミング、数学推論などのタスクが含まれます。検証可能な報酬からの強化学習(RLVR)フレームワークを通じて、大規模言語モデルのパフォーマンスを向上させることを目的としています。

データサンプルは、簡単なものから難しいものへとカリキュラム学習の順序で配置され、バランスの取れた学習進行を保証します。NeMo Gym フレームワークのポストトレーニング段階向けに特別に設計されており、商用利用をサポートしています。

データセット構成

このデータセットはハイブリッドデータセットであり、以下のコンポーネントデータセットが指定された比率でブレンドされています:

  • nvidia/Nemotron-RL-instruction_following (0.17)
  • nvidia/Nemotron-RL-knowledge-mcqa (0.20)
  • nvidia/Nemotron-RL-agent-workplace_assistant (0.10)
  • nvidia/Nemotron-RL-instruction_following-structured_outputs (0.05)
  • nvidia/Nemotron-RL-coding-competitive_coding (0.25)
  • BytedTsinghua-SIA/DAPO-Math-17k (0.10)
  • Skywork/Skywork-OR1-RL-Data (OmniMath を除く) (0.12)

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています