HyperAI
Command Palette
Search for a command to run...
Nemotron-3-Nano-RL-Training-Blend 強化学習トレーニングデータセット
Nemotron-3-Nano-RL-Training-Blend は、NVIDIA が 2025 年に公開した、Nemotron-3-Nano-30B-A3B モデルのトレーニング用に設計された厳選データセットです。93,244 個のサンプル、総ストレージ容量 6.92 GB を含み、データ規模は適度で、慎重にブレンドおよび前処理されています。複数のサブデータセットを比率に応じてブレンドしたもので、命令追従、知識 Q&A、職場アシスタント、構造化出力、競技プログラミング、数学推論などのタスクが含まれます。検証可能な報酬からの強化学習(RLVR)フレームワークを通じて、大規模言語モデルのパフォーマンスを向上させることを目的としています。
データサンプルは、簡単なものから難しいものへとカリキュラム学習の順序で配置され、バランスの取れた学習進行を保証します。NeMo Gym フレームワークのポストトレーニング段階向けに特別に設計されており、商用利用をサポートしています。
データセット構成
このデータセットはハイブリッドデータセットであり、以下のコンポーネントデータセットが指定された比率でブレンドされています:
- nvidia/Nemotron-RL-instruction_following (0.17)
- nvidia/Nemotron-RL-knowledge-mcqa (0.20)
- nvidia/Nemotron-RL-agent-workplace_assistant (0.10)
- nvidia/Nemotron-RL-instruction_following-structured_outputs (0.05)
- nvidia/Nemotron-RL-coding-competitive_coding (0.25)
- BytedTsinghua-SIA/DAPO-Math-17k (0.10)
- Skywork/Skywork-OR1-RL-Data (OmniMath を除く) (0.12)
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。