HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-RL-Agentic-Terminal-Pivot-v1 终端智能体强化学习数据集

日期

数据集组织

英伟达

许可证

CC BY 4.0

Nemotron-RL-Agentic-Terminal-Pivot-v1 是由 NVIDIA 于 2026 年发布的终端智能体强化学习数据集,旨在为大语言模型提供用于终端(命令行)交互场景的强化学习训练样本。该数据集专为 NeMo Gym 的 terminus_judge 环境设计,可用于智能体的强化学习后训练、监督微调或行为离线分析。

该数据集包含 31,111 个训练样本,源自 630 个 ATCB 种子任务与 2,716 条不同的源轨迹,任务场景涵盖工业系统、高性能计算集群、医疗、金融及媒体归档等领域的长期终端操作,如数据管道构建、故障审计、服务诊断与安全合规流程。每个任务对应的样本中位数为 45,样本均为从成功完成最终任务的智能体轨迹中提取的单个智能体决策点,包含任务提示、由以 GLM-5.1 为教师模型的 Terminus-2 智能体生成的下一步参考动作以及用于奖励评分的路由信息。其中任务提示的平均长度约 39,900 字符,下一步参考动作平均约 970 字符。

数据字段:

  • responses_create_params.input:提示词,包含任务指令及至决策点前的终端交互历史
  • expected_answer:智能体在该点的参考下一步动作
  • agent_ref:指向 NeMo Gym terminus_judge 资源服务器的路由信息,用于策略模型动作评分与强化学习奖励生成
  • metadata:包含 5 个子字段的元数据对象,已移除内部采集标识与基础设施信息

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供