HyperAI
Command Palette
Search for a command to run...
数据集概述
Calendar Scheduling Dataset 是由 NVIDIA 于 2025 年发布的一个多轮对话数据集,旨在理解自然语言调度约束并遵循多轮指令以解决冲突。
该数据集包含通过合成方法生成的多轮对话数据,用于训练大型语言模型在复杂约束下进行事件调度的能力。 数据生成过程基于预设的角色人格,模拟用户以随机顺序提出包含时长和时段约束的事件需求,助手需综合所有约束条件完成调度。 该数据集作为 NVIDIA NeMo Gym 框架的一部分发布,旨在支持可验证奖励强化学习(RLVR)的训练环境构建,帮助社区提升模型的多轮指令遵循能力。
数据集组成
该数据集主要包含以下字段和结构:
- conversation:多轮对话记录,包含用户与助手的交互过程,以用户最后一条消息结束。
- exp_cal_state:字典格式,包含日历中的事件列表及其关联的时长和约束条件,可用于验证调度结果的准确性。
数据集分为训练集和验证集两个子集,总样本量为 4000 条。具体分布如下:
- 训练集(train):3872 条
- 验证集(validation):128 条
数据存储格式为文本,总存储大小约为 43 MB。
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。