HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-3-Super-RL-Training-Blends 超级强化学习训练混合数据集

日期

数据集组织

英伟达

许可证

CC BY 4.0

Nemotron-3-Super-RL-Training-Blends 是由 NVIDIA 于 2026 年发布的强化学习训练数据混合集,用于训练 Nemotron-3-Super-120B-A12B 模型,包含 479,303 条样本,总规模约 26.3 GB,数据采用 JSONL 格式,旨在为大语言模型的强化学习从可验证奖励(RLVR)及后训练提供经过配比和预处理的数据。

数据集组成

  • RLVR 1:包含数学推理、工具使用、代码竞赛、指令跟随、安全等多种任务数据,共 138,712 条样本。

  • RLVR 2:在 RLVR 1 的基础上调整不同数据源的混合比例,共 156,278 条样本。

  • RLVR 3:进一步调整数据配比,增加代理能力、函数调用和强化学习相关数据,共 107,037 条样本。

  • SWE 1:主要由 R2E-Gym-Subset(79.70%)和 SWE-Gym(20.30%)组成,共 50,661 条样本。

  • SWE 2:主要由 R2E-Gym-Subset(81.18%)和 SWE-Gym(18.82%)组成,共 1,444 条样本。

  • RLHF:主要由 Nemotron-RLHF-GenRM-v1(77.00%)、Nemotron-RL-Agentic-Conversational-Tool-Use-v1(20.00%)和 Nemotron-RL-Identity-Following-v1(3.00%)组成,共 25,171 条样本。

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供