HyperAI
Command Palette
Search for a command to run...
Nemotron-RL-Agentic-Terminal-Pivot-v1 是由 NVIDIA 于 2026 年发布的终端智能体强化学习数据集,旨在为大语言模型提供用于终端(命令行)交互场景的强化学习训练样本。该数据集专为 NeMo Gym 的 terminus_judge 环境设计,可用于智能体的强化学习后训练、监督微调或行为离线分析。
该数据集包含 31,111 个训练样本,源自 630 个 ATCB 种子任务与 2,716 条不同的源轨迹,任务场景涵盖工业系统、高性能计算集群、医疗、金融及媒体归档等领域的长期终端操作,如数据管道构建、故障审计、服务诊断与安全合规流程。每个任务对应的样本中位数为 45,样本均为从成功完成最终任务的智能体轨迹中提取的单个智能体决策点,包含任务提示、由以 GLM-5.1 为教师模型的 Terminus-2 智能体生成的下一步参考动作以及用于奖励评分的路由信息。其中任务提示的平均长度约 39,900 字符,下一步参考动作平均约 970 字符。
数据字段:
- responses_create_params.input:提示词,包含任务指令及至决策点前的终端交互历史
- expected_answer:智能体在该点的参考下一步动作
- agent_ref:指向 NeMo Gym terminus_judge 资源服务器的路由信息,用于策略模型动作评分与强化学习奖励生成
- metadata:包含 5 个子字段的元数据对象,已移除内部采集标识与基础设施信息
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。