HyperAIHyperAI

Command Palette

Search for a command to run...

データセットのコンパイル|競技数学からツールアプリケーションまで:MIT、NVIDIA、華中科技大学などによる9つのオープンソース数学データセット。CoT、マルチモーダル推論、長連鎖思考トレーニングを網羅。

Featured Image

数学的推論能力は、大規模言語モデル(LLM)の知能レベルを測る上で重要な指標となっている。算術計算からオリンピックレベルの問題、そして多段階の計画立案やツール活用に至るまで、モデルは「答えを提供する」段階から「問題を理解し、推論を完了する」段階へと進化している。

従来の質問応答データセットと比較して、数学的推論に関するデータは、思考プロセスと推論の連鎖をより重視している。高品質なデータは、正確な回答を提供するだけでなく、モデルが問題を分解し、論理ループを構築し、複雑なタスク下での安定性を向上させるのに役立つ、標準化された推論経路、複数の経路による解決策、および検証可能な結果を提供する必要がある。

近年、OpenAI、NVIDIA、Alibaba Cloudなどのチームは推論モデルの反復開発を加速させており、数学データセットは単純な問題セットから、長連鎖推論(CoT)、ツール強化型推論、マルチモーダル理解、強化学習トレーニング、知識構造モデリングを網羅する包括的なリソースへと進化している。

本稿では、代表的な数学的推論データセットを9つまとめた。対象となる分野は、競技レベルの問題、多言語・マルチモーダル推論、推論軌跡のモデル生成、ツール支援型ソリューション、知識依存性モデリングなど多岐にわたります。これらの傾向は、数学的推論データが推論モデルの進化のための基盤になりつつあることを示しており、将来、大規模モデル間の競争は、パラメータの規模だけでなく、高品質のデータを通じて信頼性が高く、検証可能で、応用可能な推論能力を学習できるかどうかにかかってくるだろう。

HyperAIでは、以下のデータセットが利用可能になりました。これにより、研究者や開発者は、トレーニング、評価、およびアプリケーションを迅速に探索できます。

クリックして、さらに質の高いチュートリアルをご覧ください。

https://hyper.ai/datasets

1.数学グラフ 数学定理 依存関係グラフデータセット

オンラインで実行:https://go.hyper.ai/oSSEs

Math-Graphは、ワシントン大学数理人工知能研究所が2026年に公開した、数学定理の依存関係グラフのデータセットです。これは、定理のステートメントレベルでの依存関係グラフを構築します。関連論文のタイトルは「TheoremGraph: Bridging Formal and Informal Mathematics」です。

このデータセットには、非公式な数学的記述と公式な数学的記述のペアが47,952組含まれており、非公式な数学と公式な数学の両方を網羅する一貫性のある依存関係グラフに、2種類の数学的知識が統合されています。これには、論文のメタデータ、数学的記述(公式/非公式)、依存関係のエッジ、およびLLMによって生成された自然言語による説明が含まれます。

2.Nemotron-SFT-Math-v4 数学的推論SFTデータセット

オンラインで実行:https://go.hyper.ai/MU9v3

Nemotron-SFT-Math-v4は、NVIDIAが2026年5月に公開した数学的推論データセットです。関連論文のタイトルは「Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision」です。このデータセットは、従来の数学データセットにおける品質のばらつき、非標準的な推論軌跡、低い精度、限られたシナリオといった問題を解決することを目的としています。モデルの構造化推論、マルチ軌跡推論、および解答検証機能を効果的に向上させます。大規模な数学的推論モデルの微調整、推論軌跡分析、解答検証アルゴリズムの開発、ロングコンテキスト推論システムの構築、およびモデル推論の堅牢性評価に幅広く利用されています。 

このデータセットには、545,431個のトレーニングサンプルが含まれており、その内訳はCOT推論サンプル285,516個とTIRツール推論サンプル259,915個です。競技会や大学における代数、幾何学、数論、組み合わせ論などの数学的シナリオを網羅しています。データは、手動と自動を組み合わせたハイブリッド方式で注釈付けされており、固有番号、質問文、複数ターン対話、標準回答、ソース、プロトコルなどの標準化されたフィールドが含まれています。

3.MathNetマルチモーダル数学ベンチマーク推論データセット

オンラインで実行:https://go.hyper.ai/XA6AN

MathNetは、MITの研究チームがキング・アブドラ科学技術大学をはじめとする複数の機関と共同で2026年に公開した、大規模かつ多言語・マルチモーダルな数学的推論データセットです。関連論文のタイトルは「MathNet:数学的推論と検索のためのグローバルなマルチモーダルベンチマーク」です。この手法は、オリンピックレベルの数学的推論および構造化検索タスクにおける大規模モデルの能力を評価および向上させることを目的としており、数学的推論評価、RAG研究、およびマルチモーダルAIトレーニングで広く使用されています。

このデータセット(バージョンv0)には、27,817問のエキスパートレベルの数学問題とその標準解答が収録されています。58の国と地域から17言語で出題された公式数学コンテストの問題を網羅しており、5,148問の図解付き問題と、合計7,541点の幾何学的およびグラフによる図解が含まれています。このデータセットは、代数、幾何学、数論、組み合わせ論、微積分、確率と統計、およびその他のオリンピック数学知識体系をカバーしています。数学問題の解決、数学的意味検索(構造的に同等で類似した問題の特定)、および検索強化問題解決という3つのベンチマークタスクをサポートします。

4Nemotron-Math-v2 数学的推論データセット

オンラインで実行:https://go.hyper.ai/rYdfW

Nemotron-Math-v2は、NVIDIA Corporationが2025年に公開した数学的推論データセットです。関連研究は「Nemotron-Math:マルチモード監視による数学的推論の効率的な長コンテキスト蒸留」と題されています。これは主に、構造化された数学的推論を実行するLLMのトレーニング、ツール強化推論と純粋言語推論の違いの研究、および長コンテキストまたはマルチパス推論システムの構築に使用されます。

このデータセットには、約347,000件の高品質な数学問題と、モデルによって生成された700万件の推論軌跡が含まれています。各問題は、推論深度が高/中/低、Python TIRの有無の6つの構成で解かれ、LLMをアービターとして用いたパイプラインによって検証されます。

5. CHIMERA汎用推論合成データセット

オンラインで実行:https://go.hyper.ai/JskxG

CHIMERAは、推論トレーニング専用に設計された合成推論データセットです。関連論文のタイトルは「CHIMERA:汎用的なLLM推論のためのコンパクトな合成データ」です。

このデータセットは、STEM分野の幅広い領域を網羅し、ロングチェーン思考(CoT)の軌跡を提供します。数学、コンピュータサイエンス、化学、物理学、文学、歴史、生物学、音声学の8つの分野にわたる9,225の質問が含まれています。すべての例は大規模言語モデル(LLM)によって生成され、手動による注釈なしに自動的に検証されます。

6. Open-RL推論問題データセット

オンラインで実行:https://go.hyper.ai/WYDck

Open-RLは、Turingが2026年に公開した、複数の領域にわたる推論問題データセットです。物理学、数学、生物学、化学における、独立した、検証可能な、明確なSTEM推論問題が含まれています。各問題は複数段階の推論を必要とし、記号演算や数値計算を伴い、客観的に検証可能な最終解答を持ちます。

このデータセットは、強化学習の微調整、報酬モデリング、結果に基づく教師あり学習、および検証可能な推論ベンチマークに適しています。それぞれの問題は、複数の推論段階を必要とし、記号演算と数値計算を伴い、検証可能な最終解答が得られる。

7. GPT-5.4 ステップワイズ推論データセット

オンラインで実行:https://go.hyper.ai/CeBEp

GPT-5.4ステップバイステップ推論データセットは、長連鎖推論(CoT)モデリングと複雑な問題解決タスク向けに設計された高密度合成推論データセットです。このデータセットは「マスターアーキテクト」ワークフローに基づいて構築されており、gemini 3フラッシュを使用して難易度の高いヒントを生成し、これをGPT-5.4推論コアと組み合わせることで、複数ステップの推論と結果生成を完了させます。

このデータセットには、数学、プログラミング、医学といった高度に複雑な分野を網羅した、約1,500件のエリートレベルのサンプルが含まれています。課題の難易度は、「グランドマスター」レベルと「博士号取得者」レベルに統一されています。データサンプルには、完全な多段階推論プロセスと検証済みの最終解答が含まれているため、長鎖論理導出や高度な推論能力の評価を伴うシナリオに適しています。

8.Sutra 10B 事前学習用教育・訓練データセット

オンラインで実行:https://go.hyper.ai/skT3q

Sutra 10B Pretrainingは、大規模言語モデルの事前学習のための高品質な教育用データセットです。Sutraフレームワークによって生成され、構造化された教育コンテンツを作成し、言語モデルの事前学習を最適化します。これはSutraシリーズの中で最大のデータセットであり、高密度で適切にキュレーションされたデータセットが、小規模言語モデルの事前学習においていかに最適なパフォーマンスを発揮できるかを示すために設計されています。

このデータセットには、10,193,029件の教育記録が含まれており、総トークン数は100億を超え、学際分野、テクノロジー、科学、社会科、数学、生活技能、芸術と創造性、言語芸術、哲学と倫理の9つの主要分野を網羅しています。データは確立された教育パラダイムに従っており、基礎から応用まで10段階の難易度で、優れた階層構造と体系的な組織化が示されています。

9. VisCoR-55K ビジュアル推論データセット

オンラインで実行:https://go.hyper.ai/kIlWk

VisCoR-55Kは、華中科技大学がアリババクラウドと共同で2026年に公開した、高品質な視覚推論データセットです。このデータセットには約55,000個の視覚推論サンプルが含まれており、それぞれのサンプルは対照的なサンプルを用いて対応する推論プロセスを生成します。一般、推論、数学、グラフ作成、OCRの5つのカテゴリを網羅した、高品質な視覚推論データセット。その目的は、信頼性が高く堅牢な視覚的推論における視覚言語モデルに関する研究を促進することである。