HyperAI
Command Palette
Search for a command to run...
Reasoning Corpus 大模型思维链数据集
Reasoning Corpus 是由 SupraLabs 发布的大模型思维链数据集,主要用于监督微调(SFT)、模型蒸馏以及指令训练。 该数据集总规模约 500 万条样本,单条序列长度控制在 5,000 个 token 以内,每个样本都包含原始用户提示、推理轨迹、最终助手响应、来源信息、估计的 token 长度以及预格式化的 ChatML 表示。数据源自 60 余个公开推理数据仓库,涵盖科学、数学、代码、逻辑推理、金融与经济、医学及多语言 STEM 等多个领域,整合了 DeepSeek-v4 、 DeepSeek-r1 、 Qwen3 、 Gemma4 等主流大模型生成的思维链数据。
数据字段:
- repo_id:上游数据源仓库标识
- tok_len:预计算的样本 token 长度估计值
- user:原始用户提示词或任务指令
- thought_trace:模型生成的中间推理思维链
- assistant:基于推理过程得出的最终回答
- ChatML:预格式化的标准 ChatML 格式文本
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。