HyperAIHyperAI

Command Palette

Search for a command to run...

Reasoning Corpus  大模型思维链数据集

日期

7 小时前

许可证

Apache 2.0

Reasoning Corpus 是由 SupraLabs 发布的大模型思维链数据集,主要用于监督微调(SFT)、模型蒸馏以及指令训练。 该数据集总规模约 500 万条样本,单条序列长度控制在 5,000 个 token 以内,每个样本都包含原始用户提示、推理轨迹、最终助手响应、来源信息、估计的 token 长度以及预格式化的 ChatML 表示。数据源自 60 余个公开推理数据仓库,涵盖科学、数学、代码、逻辑推理、金融与经济、医学及多语言 STEM 等多个领域,整合了 DeepSeek-v4 、 DeepSeek-r1 、 Qwen3 、 Gemma4 等主流大模型生成的思维链数据。

数据字段:

  • repo_id:上游数据源仓库标识
  • tok_len:预计算的样本 token 长度估计值
  • user:原始用户提示词或任务指令
  • thought_trace:模型生成的中间推理思维链
  • assistant:基于推理过程得出的最终回答
  • ChatML:预格式化的标准 ChatML 格式文本

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供