HyperAIHyperAI

Command Palette

Search for a command to run...

数据集汇总丨从竞赛数学到工具调用,MIT/NVIDIA/华中科大等开源 9 个数学数据集,覆盖 CoT 、多模态推理与长链思维训练

Featured Image

数学推理已成为衡量大语言模型(LLM)智能水平的核心指标。从算术计算到奥林匹克级问题,再到多步规划与工具调用,模型正从「给出答案」迈向「理解问题并完成推理」。

相比传统问答数据集,数学推理数据更强调思考过程与推理链条。高质量数据不仅要有准确答案,还需提供规范化的推理轨迹、多路径求解与可验证结果,帮助模型拆解问题、构建逻辑闭环,提升复杂任务下的稳定性。

近年来,OpenAI 、 NVIDIA 、阿里云等团队加速 Reasoning 模型迭代,数学数据集也从单纯的题目集合,演变为覆盖长链思维(CoT)、工具增强推理、多模态理解、强化学习训练及知识结构建模的综合资源。

本文整理了 9 个代表性数学推理数据集,覆盖竞赛级问题、多语言多模态推理、模型生成推理轨迹、工具辅助求解及知识依赖关系建模等方向。这些趋势表明,数学推理数据正成为 Reasoning 模型进化的基础设施——未来大模型的竞争,不仅取决于参数规模,更在于能否通过高质量数据习得可靠、可验证、可迁移的推理能力。

以下数据集已在 HyperAI 上线,助力研究人员与开发者快速探索训练、评测与应用。

点击查看更多优质教程:

https://hyper.ai/datasets

1.Math-Graph 数学定理依赖图数据集

在线运行:https://go.hyper.ai/oSSEs

Math-Graph 是由华盛顿大学数学人工智能实验室于 2026 年发布的数学定理依赖图数据集,构建了一个语句级粒度的数学定理依赖图,相关论文成果为 TheoremGraph: Bridging Formal and Informal Mathematics 。

该数据集包含 47,952 条非形式化与形式化数学的语句匹配对,将两类数学知识整合为一张连贯的依赖图,覆盖非形式化(informal)与形式化(formal)数学,涵盖论文元数据、数学语句(形式/非形式)、依赖关系边以及 LLM 生成的自然语言描述数据。

2.Nemotron-SFT-Math-v4 数学推理 SFT 数据集

在线运行:https://go.hyper.ai/MU9v3

Nemotron-SFT-Math-v4 是由 NVIDIA 于 2026 年 5 月发布的数学推理数据集,相关论文成果为 Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision,旨在解决传统数学数据集质量参差不齐、推理轨迹不规范、准确率低、场景单一的问题,有效提升模型结构化推理、多轨迹推理与答案校验能力,广泛用于大模型数学推理微调、推理轨迹分析、答案校验算法研发、长上下文推理系统搭建与模型推理鲁棒性评测。 

该数据集包含 545,431 条训练样本,涵盖 285,516 条 COT 思维推理样本与 259,915 条 TIR 工具推理样本,覆盖代数、几何、数论、组合数学等竞赛与高校科研级数学场景,数据采用人工与自动化混合标注方式,包含唯一编号、题目文本、多轮对话、标准答案、来源、协议等标准化字段。

3.MathNet 多模态数学基准推理数据集

在线运行:https://go.hyper.ai/XA6AN

MathNet 是由 MIT 团队联合阿卜杜拉国王科技大学等机构于 2026 年发布的一个大规模多语言、多模态数学推理数据集,相关论文成果为 MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval,旨在评估与提升大模型在奥林匹克级数学推理与结构化检索任务中的能力,广泛应用于用于数学推理评测、 RAG 研究及多模态 AI 训练等方向。

该数据集为 v0 版本,共收录 27,817 道专家级数学试题及配套标准解答,涵盖 58 个国家和地区、 17 种语言的官方数学竞赛真题,其中包含 5,148 道配图试题、共计 7,541 张几何及图形辅助配图。数据集覆盖代数、几何、数论、组合数学、微积分、概率统计等奥数知识体系,支持数学问题求解、数学语义检索(识别结构等价及相似试题)、检索增强问题求解 3 个基准任务。

4.Nemotron-Math-v2 数学推理数据集

在线运行:https://go.hyper.ai/rYdfW

Nemotron-Math-v2 是一个由 NVIDIA Corporation 于 2025 年发布的数学推理数据集,相关文论成果为 Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision 。主要用于训练 LLM 以执行结构化数学推理,研究工具增强的推理与纯语言推理的差异,以及构建长语境或多轨迹推理系统等。

该数据集包含约 34.7 万个高质量数学问题和 700 万个模型生成的推理轨迹。每个问题在六种配置下进行求解:高 / 中 / 低推理深度与是否使用 Python TIR,答案通过 LLM 作为裁判的管道进行验证。

5.CHIMERA 通用推理合成数据集

在线运行:https://go.hyper.ai/JskxG

CHIMERA 是一个专为推理训练设计的合成推理数据集,相关论文成果为 CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning 。

该数据集涵盖广泛的 STEM 学科,并提供长链思维(CoT)轨迹,包含 9,225 个问题,8 个学科(数学、计算机科学、化学、物理、文学、历史、生物学、语音学),所有示例均由大型语言模型(LLM)生成,并通过自动验证,无需人工标注。

6.Open-RL 推理问题数据集

在线运行:https://go.hyper.ai/WYDck

Open-RL 是由 Turing 于 2026 年发布的多领域推理问题数据集,包含物理学、数学、生物学和化学的独立、可验证和明确的 STEM 推理问题。每个问题需要多步推理,涉及符号操作和/或数值计算,且具有可客观验证的最终答案。

该数据集适合用于强化学习微调、奖励建模、结果监督训练以及可验证推理基准测试。每个问题需要多步推理,并涉及符号操作和数值计算,具有可验证的最终答案。

7.GPT-5.4 逐步推理数据集

在线运行:https://go.hyper.ai/CeBEp

GPT-5.4-step-by-step-reasoning 逐步推理数据集是一个高密度合成推理数据集,面向长链思维(CoT)建模与复杂问题求解任务。数据集基于「Master-Architect」流程构建,由 gemini 3 flash 生成高难度提示,结合 GPT-5.4 Reasoning Core 完成多步推理与结果生成。

该数据集包含约 1,500 条精英级样本,覆盖数学、编程与医学等高复杂度领域,任务难度统一设定为「Grandmaster」及「Beyond-PhD」级别。数据样本包含完整多步推理过程及验证后的最终解答,适用于长链逻辑推导与极限推理能力评估场景。

8.Sutra 10B Pretraining 教学训练数据集

在线运行:https://go.hyper.ai/skT3q

Sutra 10B Pretraining 是一个用于大语言模型预训练的高质量教学数据集,由 Sutra 框架生成,创建了结构化的教育内容,优化了语言模型的预训练。这是 Sutra 系列中最大的一个数据集,旨在展示密集、精心策划的数据集如何为小型语言模型提供最佳的预训练性能。

该数据集共包含 10,193,029 条教学记录,总规模超过 100 亿个 token,涵盖跨学科、技术、科学、社会研究、数学、生活技能、艺术与创意、语言艺术以及哲学与伦理学等九大领域。数据内容遵循成熟的教学范式设计,难度由基础到高级划分为 10 个等级,具备良好的层次性与系统性。

9.VisCoR-55K 视觉推理数据集

在线运行:https://go.hyper.ai/kIlWk

VisCoR-55K 是由华中科技大学联合阿里云与 2026 年发布的一个高质量视觉推理数据集,该数据集包含约 55,000 个视觉推理样本,每个样本都利用对比样本生成相应的推理过程,涵盖通用、推理、数学、图表及 OCR 五大类别的高质量视觉推理数据集,旨在促进视觉语言模型在可信且稳健的视觉推理方面的研究。