Command Palette
Search for a command to run...
Compilation De Jeux De Données | Des Mathématiques De Compétition Aux Applications d'outils : 9 Jeux De Données Mathématiques Open Source Du MIT, De NVIDIA, De l'Université Des Sciences Et Technologies De Huazhong, etc., Couvrant La Théorie Des Objets, Le Raisonnement Multimodal Et l'entraînement À La Pensée En Chaîne longue.

Le raisonnement mathématique est devenu un indicateur essentiel pour mesurer le niveau d'intelligence des grands modèles de langage (LLM). Des calculs arithmétiques aux problèmes de niveau olympique, puis à la planification en plusieurs étapes et à l'utilisation d'outils, le modèle évolue de la simple fourniture de réponses à la compréhension des problèmes et à la réalisation du raisonnement.
Comparé aux ensembles de données traditionnels de questions-réponses,Les données relatives au raisonnement mathématique mettent davantage l'accent sur le processus de pensée et la chaîne de raisonnement.Des données de haute qualité doivent non seulement fournir des réponses précises, mais aussi des trajectoires de raisonnement standardisées, des solutions à chemins multiples et des résultats vérifiables pour aider le modèle à décomposer le problème, à construire des boucles logiques et à améliorer la stabilité dans le cadre de tâches complexes.
Ces dernières années, des équipes telles qu'OpenAI, NVIDIA et Alibaba Cloud ont accéléré l'itération des modèles de raisonnement, et les ensembles de données mathématiques sont passés de simples ensembles de problèmes à des ressources complètes couvrant le raisonnement en chaîne longue (CoT), le raisonnement amélioré par des outils, la compréhension multimodale, l'apprentissage par renforcement et la modélisation de la structure des connaissances.
Cet article compile neuf ensembles de données représentatifs du raisonnement mathématique.Il couvre des domaines tels que les problèmes de niveau compétition, le raisonnement multilingue et multimodal, la génération de modèles de trajectoires de raisonnement, la résolution assistée par outils et la modélisation des dépendances de connaissances.Ces tendances indiquent que les données de raisonnement mathématique deviennent l'infrastructure de l'évolution des modèles de raisonnement ; la concurrence entre les grands modèles dépendra à l'avenir non seulement de l'échelle des paramètres, mais aussi de la capacité à apprendre des capacités de raisonnement fiables, vérifiables et transférables grâce à des données de haute qualité.
Les jeux de données suivants sont désormais disponibles sur HyperAI, permettant aux chercheurs et aux développeurs d'explorer rapidement les ressources d'entraînement, d'évaluation et d'application.
Cliquez ici pour voir plus de tutoriels de haute qualité :
1.Jeu de données de graphes de dépendances : théorème mathématique Math-Graph
Exécutez en ligne :https://go.hyper.ai/oSSEs
Math-Graph est un ensemble de données de graphes de dépendance de théorèmes mathématiques, publié en 2026 par le Laboratoire d'intelligence artificielle mathématique de l'Université de Washington. Il construit un graphe de dépendance de théorèmes mathématiques au niveau de chaque énoncé. L'article associé s'intitule « TheoremGraph : Bridging Formal and Informal Mathematics » (Le lien entre mathématiques formelles et informelles).
Cet ensemble de données contient 47 952 paires d'énoncés mathématiques formels et informels, intégrant les deux types de connaissances mathématiques dans un graphe de dépendances cohérent qui couvre à la fois les mathématiques formelles et informelles. Il comprend les métadonnées des articles, les énoncés mathématiques (formels/informels), les arêtes de dépendance et les descriptions en langage naturel générées par LLM.
2.Nemotron-SFT-Math-v4 Jeu de données SFT pour l'inférence mathématique
Exécutez en ligne :https://go.hyper.ai/MU9v3
Nemotron-SFT-Math-v4 est un jeu de données de raisonnement mathématique publié par NVIDIA en mai 2026. L'article associé, intitulé « Nemotron-Math : Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision », vise à résoudre les problèmes de qualité inégale, de trajectoires de raisonnement non standardisées, de faible précision et de scénarios limités rencontrés dans les jeux de données mathématiques traditionnels. Il améliore efficacement le raisonnement structuré, le raisonnement multi-trajectoires et les capacités de vérification des réponses du modèle. Il est largement utilisé pour l'optimisation de modèles de raisonnement mathématique à grande échelle, l'analyse des trajectoires de raisonnement, le développement d'algorithmes de vérification des réponses, la construction de systèmes de raisonnement à contexte long et l'évaluation de la robustesse du raisonnement des modèles.
Cet ensemble de données contient 545 431 exemples d'entraînement, dont 285 516 exemples de raisonnement COT et 259 915 exemples de raisonnement TIR. Il couvre des scénarios mathématiques issus de compétitions et de recherches universitaires en algèbre, géométrie, théorie des nombres, combinatoire, etc. Les données sont annotées à l'aide d'une méthode hybride manuelle et automatisée et comprennent des champs standardisés tels qu'un numéro unique, le texte de la question, le dialogue à plusieurs tours, la réponse standard, la source et le protocole.
3.Ensemble de données de référence multimodal MathNet pour l'inférence mathématique
Exécutez en ligne :https://go.hyper.ai/XA6AN

MathNet est un ensemble de données de raisonnement mathématique multilingue et multimodal à grande échelle, publié en 2026 par une équipe du MIT en collaboration avec l'Université des sciences et technologies du roi Abdallah et d'autres institutions. L'article associé s'intitule « MathNet : un banc d'essai multimodal mondial pour le raisonnement et la recherche mathématiques ».Il vise à évaluer et à améliorer les capacités des grands modèles dans les tâches de raisonnement mathématique et de recherche structurée de niveau olympique, et est largement utilisé dans l'évaluation du raisonnement mathématique, la recherche RAG et la formation en IA multimodale.
Ce jeu de données, version v0, contient 27 817 problèmes mathématiques de niveau expert et leurs solutions standard. Il couvre les problèmes officiels de concours de mathématiques de 58 pays et régions, en 17 langues, dont 5 148 problèmes illustrés avec un total de 7 541 illustrations géométriques et graphiques. Le jeu de données couvre l'algèbre, la géométrie, la théorie des nombres, la combinatoire, le calcul différentiel et intégral, les probabilités et les statistiques, ainsi que d'autres systèmes de connaissances mathématiques des Olympiades. Il prend en charge trois tâches de référence : la résolution de problèmes mathématiques, la recherche sémantique mathématique (identification de problèmes structurellement équivalents et similaires) et la résolution de problèmes d'amélioration de la recherche.
4Ensemble de données d'inférence mathématique Nemotron-Math-v2
Exécutez en ligne :https://go.hyper.ai/rYdfW
Nemotron-Math-v2 est un ensemble de données de raisonnement mathématique publié par NVIDIA Corporation en 2025. Les recherches associées s'intitulent « Nemotron-Math : Distillation efficace du raisonnement mathématique à long contexte à partir d'une supervision multimodale ». Il est principalement utilisé pour entraîner des modèles de langage à effectuer un raisonnement mathématique structuré, pour étudier les différences entre le raisonnement assisté par des outils et le raisonnement en langage naturel, et pour construire des systèmes de raisonnement à long contexte ou à chemins multiples.
Cet ensemble de données contient environ 347 000 problèmes mathématiques de haute qualité et 7 millions de trajectoires d'inférence générées par des modèles. Chaque problème est résolu selon six configurations : profondeur d'inférence élevée, moyenne et faible, avec ou sans Python TIR. Les réponses sont validées par un pipeline utilisant un LLM comme arbitre.
5. Jeu de données synthétiques d'inférence générale CHIMERA
Exécutez en ligne :https://go.hyper.ai/JskxG
CHIMERA est un ensemble de données de raisonnement synthétique conçu spécifiquement pour l'entraînement au raisonnement. L'article associé s'intitule CHIMERA : Données synthétiques compactes pour le raisonnement LLM généralisable.
Cet ensemble de données couvre un large éventail de disciplines STEM et propose des parcours de raisonnement logique (Long Chain Thinking - CoT). Il comprend 9 225 questions réparties dans 8 disciplines (mathématiques, informatique, chimie, physique, littérature, histoire, biologie et phonétique). Tous les exemples sont générés par un modèle de langage à grande échelle (LLM) et validés automatiquement, sans annotation manuelle.
6. Ensemble de données pour le problème d'inférence Open-RL
Exécutez en ligne :https://go.hyper.ai/WYDck
OpenRL est un ensemble de données de problèmes de raisonnement multidomaines publié par Turing en 2026. Il contient des problèmes de raisonnement STEM indépendants, vérifiables et explicites en physique, mathématiques, biologie et chimie. Chaque problème requiert un raisonnement en plusieurs étapes, implique des opérations symboliques et/ou des calculs numériques, et possède une réponse finale objectivement vérifiable.
Cet ensemble de données convient au réglage fin de l'apprentissage par renforcement, à la modélisation des récompenses, à l'entraînement supervisé par les résultats et à l'évaluation comparative de l'inférence vérifiable.Chaque problème nécessite plusieurs étapes de raisonnement et implique des opérations symboliques et des calculs numériques, avec une réponse finale vérifiable.
7. Ensemble de données d'inférence par étapes GPT-5.4
Exécutez en ligne :https://go.hyper.ai/CeBEp
Le jeu de données de raisonnement pas à pas GPT-5.4 est un jeu de données synthétique haute densité conçu pour la modélisation du raisonnement à longue chaîne (CoT) et les tâches complexes de résolution de problèmes. Ce jeu de données repose sur un flux de travail « Maître-Architecte », utilisant Gemini 3 Flash pour générer des indices complexes, puis combinant ces indices avec le noyau de raisonnement GPT-5.4 pour réaliser le raisonnement multi-étapes et générer les résultats.
Cet ensemble de données contient environ 1 500 exemples de haut niveau, couvrant des domaines très complexes tels que les mathématiques, la programmation et la médecine. La difficulté des tâches est uniformément répartie entre les niveaux « Grand Maître » et « Doctorat ». Les exemples incluent des processus de raisonnement complets en plusieurs étapes et des solutions finales vérifiées, ce qui les rend adaptés aux scénarios impliquant des dérivations logiques complexes et l’évaluation de capacités de raisonnement exceptionnelles.
8.Ensemble de données d'enseignement et d'entraînement préalables Sutra 10B
Exécutez en ligne :https://go.hyper.ai/skT3q
Sutra 10B Pretraining est un jeu de données pédagogique de haute qualité destiné au préentraînement de grands modèles de langage. Généré par le framework Sutra, il crée du contenu éducatif structuré et optimise le préentraînement des modèles de langage. Il s'agit du plus grand jeu de données de la série Sutra, conçu pour démontrer comment des jeux de données denses et bien organisés peuvent offrir des performances de préentraînement optimales pour les petits modèles de langage.
Cet ensemble de données contient 10 193 029 enregistrements d'enseignement, soit plus de 10 milliards d'éléments, couvrant neuf grands domaines : interdisciplinarité, technologie, sciences, sciences sociales, mathématiques, compétences de vie, arts et créativité, lettres et littératures, et philosophie et éthique. Les données suivent un modèle pédagogique éprouvé, avec 10 niveaux de difficulté, du niveau débutant au niveau avancé, témoignant d'une hiérarchie claire et d'une organisation systématique.
9. Ensemble de données d'inférence visuelle VisCoR-55K
Exécutez en ligne :https://go.hyper.ai/kIlWk
VisCoR-55K est un jeu de données de raisonnement visuel de haute qualité, publié en 2026 par l'Université des sciences et technologies de Huazhong en collaboration avec Alibaba Cloud. Ce jeu de données contient environ 55 000 exemples de raisonnement visuel, chacun générant un processus de raisonnement correspondant à partir d'exemples contrastés.Un ensemble de données de raisonnement visuel de haute qualité couvrant cinq catégories : général, raisonnement, mathématique, graphique et OCR.L'objectif est de promouvoir la recherche sur les modèles de langage visuel pour un raisonnement visuel fiable et robuste.








