HyperAIHyperAI

Command Palette

Search for a command to run...

Calendar Scheduling Dataset 日历调度数据集

日期

数据集组织

英伟达

许可证

CC BY 4.0

数据集概述

Calendar Scheduling Dataset 是由 NVIDIA 于 2025 年发布的一个多轮对话数据集,旨在理解自然语言调度约束并遵循多轮指令以解决冲突。

该数据集包含通过合成方法生成的多轮对话数据,用于训练大型语言模型在复杂约束下进行事件调度的能力。 数据生成过程基于预设的角色人格,模拟用户以随机顺序提出包含时长和时段约束的事件需求,助手需综合所有约束条件完成调度。 该数据集作为 NVIDIA NeMo Gym 框架的一部分发布,旨在支持可验证奖励强化学习(RLVR)的训练环境构建,帮助社区提升模型的多轮指令遵循能力。

数据集组成

该数据集主要包含以下字段和结构:

  • conversation:多轮对话记录,包含用户与助手的交互过程,以用户最后一条消息结束。
  • exp_cal_state:字典格式,包含日历中的事件列表及其关联的时长和约束条件,可用于验证调度结果的准确性。

数据集分为训练集和验证集两个子集,总样本量为 4000 条。具体分布如下:

  • 训练集(train):3872 条
  • 验证集(validation):128 条

数据存储格式为文本,总存储大小约为 43 MB。

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供