HyperAIHyperAI

Command Palette

Search for a command to run...

Zusammenstellung Von Datensätzen | Von Wettbewerbsmathematik Zu Werkzeuganwendungen: 9 Open-Source-Mathematikdatensätze Vom MIT, NVIDIA, Der Huazhong University of Science and Technology usw., Die CoT, Multimodales Denken Und Das Training Von Long-Chain Thinking abdecken.

Featured Image

Mathematisches Denken hat sich zu einem zentralen Indikator für die Messung des Intelligenzniveaus von großen Sprachmodellen (LLMs) entwickelt. Von arithmetischen Berechnungen über Aufgaben auf Olympiade-Niveau bis hin zu mehrstufiger Planung und Werkzeugnutzung entwickelt sich das Modell von der „Antwortbereitstellung“ hin zum „Problemverständnis und der Durchführung von Schlussfolgerungen“.

Im Vergleich zu herkömmlichen Frage-Antwort-Datensätzen,Bei Daten zum mathematischen Denken wird der Denkprozess und die Argumentationskette stärker betont.Hochwertige Daten müssen nicht nur genaue Antworten liefern, sondern auch standardisierte Schlussfolgerungswege, Mehrwegelösungen und überprüfbare Ergebnisse bereitstellen, um dem Modell zu helfen, das Problem zu analysieren, logische Schleifen zu bilden und die Stabilität bei komplexen Aufgaben zu verbessern.

In den letzten Jahren haben Teams wie OpenAI, NVIDIA und Alibaba Cloud die Iteration von Reasoning-Modellen beschleunigt, und mathematische Datensätze haben sich von einfachen Problemsätzen zu umfassenden Ressourcen entwickelt, die Long Chain Reasoning (CoT), Tool-Enhanced Reasoning, multimodales Verständnis, Reinforcement Learning Training und Wissensstrukturmodellierung abdecken.

Dieser Artikel stellt neun repräsentative Datensätze zum mathematischen Denken zusammen.Es umfasst Bereiche wie Wettbewerbsprobleme, mehrsprachiges und multimodales Schließen, Modellgenerierung von Schlussfolgerungstrajektorien, werkzeuggestützte Lösungsfindung und Wissensabhängigkeitsmodellierung.Diese Trends deuten darauf hin, dass mathematische Schlussfolgerungsdaten zur Infrastruktur für die Entwicklung von Schlussfolgerungsmodellen werden – der Wettbewerb zwischen großen Modellen wird in Zukunft nicht nur von der Größenordnung der Parameter abhängen, sondern auch von der Fähigkeit, zuverlässige, überprüfbare und übertragbare Schlussfolgerungsfähigkeiten durch qualitativ hochwertige Daten zu erlernen.

Die folgenden Datensätze sind jetzt auf HyperAI verfügbar und helfen Forschern und Entwicklern, Training, Evaluierung und Anwendungen schnell zu erkunden.

Klicken Sie hier, um weitere hochwertige Tutorials zu sehen:

https://hyper.ai/datasets

1.Math-Graph Mathematischer Satz Abhängigkeitsgraph Datensatz

Online ausführen:https://go.hyper.ai/oSSEs

Math-Graph ist ein Datensatz mathematischer Theorem-Abhängigkeitsgraphen, der 2026 vom Labor für Mathematische Künstliche Intelligenz der Universität Washington veröffentlicht wurde. Er erstellt einen solchen Graphen auf der Ebene einzelner Aussagen. Die zugehörige Publikation trägt den Titel „TheoremGraph: Bridging Formal and Informal Mathematics“.

Dieser Datensatz enthält 47.952 Paare informeller und formaler mathematischer Aussagen und integriert die beiden Arten mathematischen Wissens in einen kohärenten Abhängigkeitsgraphen, der sowohl informelle als auch formale Mathematik abdeckt. Er umfasst Metadaten von Publikationen, mathematische Aussagen (formal/informell), Abhängigkeitskanten und LLM-generierte natürlichsprachliche Beschreibungen.

2.Nemotron-SFT-Math-v4 Mathematische Inferenz SFT-Datensatz

Online ausführen:https://go.hyper.ai/MU9v3

Nemotron-SFT-Math-v4 ist ein Datensatz für mathematisches Schließen, der von NVIDIA im Mai 2026 veröffentlicht wurde. Die zugehörige Publikation trägt den Titel „Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision“. Ziel ist es, die Probleme inkonsistenter Qualität, nicht-standardmäßiger Schlussfolgerungspfade, geringer Genauigkeit und begrenzter Szenarien in traditionellen mathematischen Datensätzen zu lösen. Der Datensatz verbessert effektiv das strukturierte Schließen, das Schließen über mehrere Trajektorien hinweg und die Antwortverifizierungsfähigkeiten des Modells. Er wird häufig für die Feinabstimmung umfangreicher Modelle für mathematisches Schließen, die Analyse von Schlussfolgerungspfaden, die Entwicklung von Algorithmen zur Antwortverifizierung, den Aufbau von Systemen für das Schließen über lange Kontexte und die Bewertung der Robustheit des Modellschlusses eingesetzt. 

Dieser Datensatz umfasst 545.431 Trainingsbeispiele, darunter 285.516 Beispiele für logisches Denken aus dem COT-Tool und 259.915 Beispiele für logisches Denken aus dem TIR-Tool. Er deckt mathematische Szenarien aus Wettbewerben und universitären Forschungsarbeiten in Algebra, Geometrie, Zahlentheorie, Kombinatorik usw. ab. Die Daten wurden mithilfe einer hybriden manuellen und automatisierten Methode annotiert und enthalten standardisierte Felder wie eindeutige Nummer, Fragetext, mehrstufiger Dialog, Standardantwort, Quelle und Protokoll.

3.MathNet Multimodaler mathematischer Benchmark-Datensatz für Inferenz

Online ausführen:https://go.hyper.ai/XA6AN

MathNet ist ein umfangreicher, mehrsprachiger und multimodaler Datensatz für mathematisches Schließen, der 2026 von einem Team des MIT in Zusammenarbeit mit der King Abdullah University of Science and Technology und anderen Institutionen veröffentlicht wurde. Die zugehörige Publikation trägt den Titel „MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval“.Ziel ist es, die Fähigkeiten großer Modelle bei mathematischen Denkaufgaben und strukturierten Suchaufgaben auf olympischem Niveau zu bewerten und zu verbessern. Es wird häufig zur Bewertung mathematischer Denkprozesse, in der RAG-Forschung und im multimodalen KI-Training eingesetzt.

Dieser Datensatz (Version v0) enthält 27.817 mathematische Aufgaben auf Expertenniveau sowie deren Standardlösungen. Er umfasst offizielle Aufgaben von Mathematikwettbewerben aus 58 Ländern und Regionen in 17 Sprachen, darunter 5.148 illustrierte Aufgaben mit insgesamt 7.541 geometrischen und grafischen Darstellungen. Der Datensatz deckt Algebra, Geometrie, Zahlentheorie, Kombinatorik, Analysis, Wahrscheinlichkeitsrechnung und Statistik sowie weitere Wissensgebiete der Mathematikolympiaden ab. Er unterstützt drei Benchmark-Aufgaben: das Lösen mathematischer Aufgaben, die mathematische semantische Suche (Identifizierung strukturell äquivalenter und ähnlicher Aufgaben) und die Verbesserung der Suchergebnisse.

4Nemotron-Math-v2 Datensatz für mathematische Inferenz

Online ausführen:https://go.hyper.ai/rYdfW

Nemotron-Math-v2 ist ein Datensatz für mathematisches Schließen, der 2025 von der NVIDIA Corporation veröffentlicht wurde. Die zugehörige Forschung trägt den Titel „Nemotron-Math: Effiziente Langzeitkontext-Destillation mathematischen Schließens aus Multi-Mode-Supervision“. Er wird primär verwendet, um LLMs für strukturiertes mathematisches Schließen zu trainieren, die Unterschiede zwischen werkzeuggestütztem und reinem sprachlichem Schließen zu untersuchen und Langzeitkontext- oder Mehrpfad-Schließsysteme zu entwickeln.

Dieser Datensatz enthält ca. 347.000 hochwertige mathematische Probleme und 7 Millionen modellgenerierte Inferenztrajektorien. Jedes Problem wird in sechs Konfigurationen gelöst: hohe/mittlere/niedrige Inferenztiefe und mit/ohne Python TIR. Die Lösungen werden anschließend mithilfe einer Pipeline validiert, die ein LLM als Arbitrator verwendet.

5. CHIMERA Allgemeiner Inferenz-Synthetikdatensatz

Online ausführen:https://go.hyper.ai/JskxG

CHIMERA ist ein synthetischer Datensatz für das Training von logischem Denken, der speziell dafür entwickelt wurde. Die zugehörige Publikation trägt den Titel CHIMERA: Kompakte synthetische Daten für generalisierbares LLM-Reasoning.

Dieser Datensatz deckt ein breites Spektrum an MINT-Fächern ab und bietet Trajektorien für langfristiges Denken (Long Chain Thinking, CoT). Er enthält 9.225 Fragen aus acht Fächern (Mathematik, Informatik, Chemie, Physik, Literatur, Geschichte, Biologie und Phonetik). Alle Beispiele wurden mithilfe eines großen Sprachmodells (Large Language Model, LLM) generiert und automatisch ohne manuelle Annotation validiert.

6. Open-RL-Inferenzproblem-Datensatz

Online ausführen:https://go.hyper.ai/WYDck

Open-RL ist ein von Turing im Jahr 2026 veröffentlichter Datensatz für domänenübergreifende Denkaufgaben. Er enthält unabhängige, verifizierbare und explizite MINT-Denkaufgaben aus den Bereichen Physik, Mathematik, Biologie und Chemie. Jede Aufgabe erfordert mehrstufiges Denken, beinhaltet symbolische Operationen und/oder numerische Berechnungen und hat eine objektiv verifizierbare Endlösung.

Dieser Datensatz eignet sich für die Feinabstimmung von Reinforcement Learning, Reward-Modellierung, ergebnisüberwachtem Training und verifizierbarem Inferenz-Benchmarking.Jede Aufgabe erfordert mehrere Denkschritte und beinhaltet symbolische Operationen und numerische Berechnungen, wobei am Ende eine überprüfbare Lösung vorliegt.

7. GPT-5.4 Schrittweiser Inferenzdatensatz

Online ausführen:https://go.hyper.ai/CeBEp

Der GPT-5.4 Step-by-Step-Reasoning-Datensatz ist ein hochdichter, synthetischer Reasoning-Datensatz, der für die Modellierung von Long-Chain Reasoning (CoT) und komplexen Problemlösungsaufgaben entwickelt wurde. Der Datensatz basiert auf einem „Master-Architect“-Workflow, der gemini 3 flash zur Generierung anspruchsvoller Hinweise nutzt und diese mit dem GPT-5.4 Reasoning Core kombiniert, um mehrstufige Schlussfolgerungen zu ziehen und Ergebnisse zu generieren.

Dieser Datensatz umfasst ca. 1.500 Beispiele auf Spitzenniveau aus hochkomplexen Bereichen wie Mathematik, Programmierung und Medizin. Der Schwierigkeitsgrad der Aufgaben ist einheitlich auf „Großmeister“- und „Über-Doktorgrad“-Niveau festgelegt. Die Datenbeispiele beinhalten vollständige, mehrstufige Denkprozesse und verifizierte Endlösungen und eignen sich daher für Szenarien mit komplexen logischen Ableitungen und zur Beurteilung außergewöhnlicher Denkfähigkeiten.

8.Sutra 10B Vortrainings- und Trainingsdatensatz

Online ausführen:https://go.hyper.ai/skT3q

Sutra 10B Pretraining ist ein hochwertiger Trainingsdatensatz für das Vortraining großer Sprachmodelle. Er wurde mit dem Sutra-Framework generiert und erstellt strukturierte Lerninhalte, die das Vortraining von Sprachmodellen optimieren. Als größter Datensatz der Sutra-Reihe demonstriert er, wie dichte, sorgfältig kuratierte Datensätze optimale Vortrainingsergebnisse für kleine Sprachmodelle ermöglichen.

Dieser Datensatz umfasst 10.193.029 Unterrichtseinheiten mit insgesamt über 10 Milliarden Tokens und deckt neun Hauptbereiche ab: interdisziplinär, Technologie, Naturwissenschaften, Sozialkunde, Mathematik, Lebenskompetenzen, Kunst und Kreativität, Sprachkunst sowie Philosophie und Ethik. Die Daten folgen einem etablierten Unterrichtsmodell mit zehn Schwierigkeitsstufen von grundlegend bis fortgeschritten und weisen eine klare Hierarchie und systematische Organisation auf.

9. VisCoR-55K Visual Inference Dataset

Online ausführen:https://go.hyper.ai/kIlWk

VisCoR-55K ist ein hochwertiger Datensatz für visuelles Schlussfolgern, der 2026 von der Huazhong University of Science and Technology in Zusammenarbeit mit Alibaba Cloud veröffentlicht wurde. Dieser Datensatz enthält ca. 55.000 Beispiele für visuelles Schlussfolgern, wobei jedes Beispiel einen entsprechenden Schlussprozess anhand kontrastierender Beispiele generiert.Ein hochwertiger Datensatz zum visuellen Denken, der fünf Kategorien abdeckt: allgemeines Denken, logisches Denken, mathematisches Denken, grafische Darstellung und OCR.Ziel ist es, die Forschung an visuellen Sprachmodellen für ein zuverlässiges und robustes visuelles Denken zu fördern.