HyperAIHyperAI

Command Palette

Search for a command to run...

데이터셋 모음 | 수학 경시대회부터 도구 응용까지: MIT, NVIDIA, 화중과학기술대학교 등에서 제공하는 9개의 오픈소스 수학 데이터셋으로 CoT(기술통찰력), 멀티모달 추론, 롱체인 사고 훈련을 다룹니다.

Featured Image

수학적 추론은 대규모 언어 모델(LLM)의 지능 수준을 측정하는 핵심 지표가 되었습니다. 산술 계산부터 올림피아드 수준의 문제, 그리고 다단계 계획 수립 및 도구 활용에 이르기까지, 모델은 단순히 "답을 제공하는 것"에서 "문제를 이해하고 추론을 완성하는 것"으로 발전하고 있습니다.

기존의 질문 답변 데이터 세트와 비교했을 때,수학적 추론 데이터는 사고 과정과 추론의 연쇄에 더 큰 비중을 둡니다.고품질 데이터는 정확한 답변을 제공할 뿐만 아니라 표준화된 추론 경로, 다중 경로 솔루션 및 검증 가능한 결과를 제공하여 모델이 문제를 분석하고 논리적 루프를 구축하며 복잡한 작업 환경에서 안정성을 향상시키도록 도와야 합니다.

최근 몇 년 동안 OpenAI, NVIDIA, Alibaba Cloud와 같은 팀들은 추론 모델의 반복적인 발전을 가속화했으며, 수학적 데이터 세트는 단순한 문제 집합에서 장쇄 추론(CoT), 도구 강화 추론, 다중 모달 이해, 강화 학습 훈련 및 지식 구조 모델링을 포괄하는 포괄적인 리소스로 발전했습니다.

이 논문에서는 대표적인 수학적 추론 데이터셋 9개를 정리했습니다.이 과정은 경쟁 수준의 문제, 다국어 및 다중 모드 추론, 추론 궤적 모델 생성, 도구 지원 솔루션, 지식 의존성 모델링과 같은 영역을 다룹니다.이러한 추세는 수학적 추론 데이터가 추론 모델 진화의 기반 시설이 되고 있음을 보여줍니다. 미래의 대규모 모델 간 경쟁은 매개변수의 규모뿐만 아니라 고품질 데이터를 통해 신뢰할 수 있고 검증 가능하며 전이 가능한 추론 능력을 학습하는 능력에도 달려 있을 것입니다.

HyperAI에서 제공하는 다음 데이터 세트를 활용하면 연구원과 개발자가 학습, 평가 및 응용 프로그램을 신속하게 탐색할 수 있습니다.

더 많은 고품질 튜토리얼을 보려면 클릭하세요:

https://hyper.ai/datasets

1.수학 그래프 수학 정리 종속성 그래프 데이터 세트

온라인으로 실행:https://go.hyper.ai/oSSEs

Math-Graph는 워싱턴 대학교 수학인공지능연구소에서 2026년에 발표한 수학 정리 의존성 그래프 데이터셋입니다. 이 데이터셋은 명제 수준에서 수학 정리 의존성 그래프를 구성합니다. 관련 논문은 "TheoremGraph: Bridging Formal and Informal Mathematics"입니다.

이 데이터셋은 비형식적 수학적 명제와 형식적 수학적 명제 쌍 47,952개를 포함하며, 두 가지 유형의 수학적 지식을 비형식 및 형식 수학 모두를 아우르는 일관된 의존성 그래프로 통합합니다. 데이터셋에는 논문 메타데이터, 수학적 명제(형식/비형식), 의존성 연결선, 그리고 LLM으로 생성된 자연어 설명이 포함됩니다.

2.Nemotron-SFT-Math-v4 수학적 추론 SFT 데이터셋

온라인으로 실행:https://go.hyper.ai/MU9v3

Nemotron-SFT-Math-v4는 NVIDIA에서 2026년 5월에 공개한 수학적 추론 데이터셋입니다. 관련 논문은 "Nemotron-Math: 다중 모드 지도 학습을 통한 효율적인 장기 컨텍스트 증류(Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision)"입니다. 이 데이터셋은 기존 수학 추론 데이터셋의 문제점인 일관성 없는 품질, 비표준적인 추론 궤적, 낮은 정확도, 제한된 시나리오 등을 해결하는 것을 목표로 합니다. Nemotron-SFT-Math-v4는 모델의 구조적 추론, 다중 궤적 추론, 정답 검증 기능을 효과적으로 향상시킵니다. 대규모 수학적 추론 모델의 미세 조정, 추론 궤적 분석, 정답 검증 알고리즘 개발, 장기 컨텍스트 추론 시스템 구축, 모델 추론 견고성 평가 등에 널리 활용되고 있습니다.

이 데이터셋은 545,431개의 훈련 샘플로 구성되어 있으며, 그중 285,516개는 COT 추론 샘플이고 259,915개는 TIR 도구 추론 샘플입니다. 이 데이터셋은 대수학, 기하학, 정수론, 조합론 등 다양한 분야의 경시대회 및 대학 연구 시나리오를 포괄합니다. 데이터는 수동 및 자동화 방식을 혼합하여 주석 처리되었으며, 고유 번호, 문제 텍스트, 다단계 대화, 표준 답변, 출처, 프로토콜 등의 표준화된 필드를 포함합니다.

3.MathNet 멀티모달 수학 벤치마크 추론 데이터셋

온라인으로 실행:https://go.hyper.ai/XA6AN

MathNet은 MIT 연구팀이 킹 압둘라 과학기술대학교 및 기타 기관과 협력하여 2026년에 공개한 대규모, 다국어, 다중 모드 수학적 추론 데이터셋입니다. 관련 논문의 제목은 "MathNet: 수학적 추론 및 검색을 위한 글로벌 다중 모드 벤치마크"입니다.이 도구는 올림픽 수준의 수학적 추론 및 구조화된 검색 작업에서 대규모 모델의 기능을 평가하고 개선하는 것을 목표로 하며, 수학적 추론 평가, RAG 연구 및 멀티모달 AI 훈련에 널리 사용됩니다.

이 데이터셋(버전 v0)은 27,817개의 전문가 수준 수학 문제와 표준 해답을 포함합니다. 58개 국가 및 지역의 공식 수학 경시대회 문제를 17개 언어로 제공하며, 그중 5,148개 문제는 총 7,541개의 기하학적 및 그래픽 삽화를 포함하고 있습니다. 데이터셋은 대수학, 기하학, 정수론, 조합론, 미적분학, 확률 및 통계, 그리고 기타 올림피아드 수학 지식 영역을 포괄합니다. 이 데이터셋은 수학 문제 풀이, 수학적 의미 검색(구조적으로 동일하거나 유사한 문제 식별), 그리고 검색 성능 향상이라는 세 가지 벤치마크 작업을 지원합니다.

4Nemotron-Math-v2 수학적 추론 데이터셋

온라인으로 실행:https://go.hyper.ai/rYdfW

Nemotron-Math-v2는 NVIDIA Corporation에서 2025년에 공개한 수학적 추론 데이터셋입니다. 관련 연구는 "Nemotron-Math: 다중 모드 지도 학습을 통한 효율적인 장기 컨텍스트 수학적 추론 추출"이라는 제목으로 발표되었습니다. 이 데이터셋은 주로 LLM(Long-Context Model)을 훈련시켜 구조화된 수학적 추론을 수행하도록 하거나, 도구 활용 추론과 순수 언어 추론의 차이점을 연구하고, 장기 컨텍스트 또는 다중 경로 추론 시스템을 구축하는 데 사용됩니다.

이 데이터 세트는 약 347,000개의 고품질 수학 문제와 700만 개의 모델 생성 추론 궤적을 포함합니다. 각 문제는 추론 깊이의 높음/중간/낮음, 그리고 Python TIR 사용 여부에 따라 6가지 구성으로 해결되며, 결과는 LLM을 검증 도구로 사용하는 파이프라인을 통해 검증됩니다.

5. CHIMERA 일반 추론 합성 데이터셋

온라인으로 실행:https://go.hyper.ai/JskxG

CHIMERA는 추론 학습을 위해 특별히 설계된 합성 추론 데이터셋입니다. 관련 논문은 "CHIMERA: 일반화 가능한 LLM 추론을 위한 컴팩트한 합성 데이터"입니다.

이 데이터셋은 광범위한 STEM 과목을 포괄하며, 8개 과목(수학, 컴퓨터 과학, 화학, 물리학, 문학, 역사, 생물학, 음성학)에 걸쳐 9,225개의 문항으로 구성된 장쇄 사고(Long Chain Thinking, CoT) 궤적을 제공합니다. 모든 예시는 대규모 언어 모델(LLM)을 통해 생성되었으며, 수동 주석 없이 자동으로 검증되었습니다.

6. 개방형 강화 학습 추론 문제 데이터셋

온라인으로 실행:https://go.hyper.ai/WYDck

Open-RL은 Turing에서 2026년에 공개한 다중 영역 추론 문제 데이터셋으로, 물리학, 수학, 생물학, 화학 분야의 독립적이고 검증 가능하며 명확한 STEM 추론 문제를 포함하고 있습니다. 각 문제는 다단계 추론을 필요로 하며, 기호 연산 및/또는 수치 계산을 포함하고, 객관적으로 검증 가능한 최종 답을 가지고 있습니다.

이 데이터셋은 강화 학습 미세 조정, 보상 모델링, 결과 중심 학습 및 검증 가능한 추론 벤치마킹에 적합합니다.각 문제는 여러 단계의 추론을 필요로 하며, 기호 연산과 수치 계산을 포함하고, 최종 답은 검증 가능해야 합니다.

7. GPT-5.4 단계별 추론 데이터셋

온라인으로 실행:https://go.hyper.ai/CeBEp

GPT-5.4 단계별 추론 데이터셋은 긴 연쇄 추론(CoT) 모델링 및 복잡한 문제 해결 작업을 위해 설계된 고밀도 합성 추론 데이터셋입니다. 이 데이터셋은 "마스터-아키텍트" 워크플로우를 기반으로 구축되었으며, Gemini 3 플래시를 사용하여 까다로운 힌트를 생성하고, 이를 GPT-5.4 추론 코어와 결합하여 다단계 추론 및 결과 생성을 완료합니다.

이 데이터 세트는 수학, 프로그래밍, 의학 등 매우 복잡한 분야를 아우르는 약 1,500개의 최상위 수준 샘플을 포함합니다. 과제 난이도는 모두 "그랜드마스터" 및 "박사 이상" 수준으로 설정되어 있습니다. 데이터 샘플에는 완전한 다단계 추론 과정과 검증된 최종 솔루션이 포함되어 있어, 긴 논리적 추론 과정과 극한의 추론 능력을 평가하는 시나리오에 적합합니다.

8.수트라 10B 사전 훈련 교육 및 훈련 데이터 세트

온라인으로 실행:https://go.hyper.ai/skT3q

Sutra 10B Pretraining은 대규모 언어 모델 사전 학습을 위한 고품질 교육용 데이터셋입니다. Sutra 프레임워크를 사용하여 생성된 이 데이터셋은 구조화된 교육 콘텐츠를 제공하고 언어 모델의 사전 학습을 최적화합니다. Sutra 시리즈 중 가장 큰 규모의 이 데이터셋은 밀도 높고 잘 선별된 데이터셋이 소규모 언어 모델에 최적의 사전 학습 성능을 제공할 수 있음을 보여주기 위해 설계되었습니다.

이 데이터 세트는 총 10,193,029개의 수업 기록(100억 개 이상의 토큰)을 포함하며, 융합 교육, 기술, 과학, 사회, 수학, 생활 기술, 예술 및 창의성, 언어 예술, 철학 및 윤리 등 9개 주요 영역을 다룹니다. 데이터는 기초부터 고급까지 10단계 난이도로 구성된 잘 정립된 교육 패러다임을 따르며, 체계적인 계층 구조를 보여줍니다.

9. VisCoR-55K 시각적 추론 데이터셋

온라인으로 실행:https://go.hyper.ai/kIlWk

VisCoR-55K는 화중과학기술대학교와 알리바바 클라우드가 협력하여 2026년에 공개한 고품질 시각 추론 데이터셋입니다. 이 데이터셋은 약 55,000개의 시각 추론 샘플을 포함하고 있으며, 각 샘플은 대조 샘플을 사용한 해당 추론 과정을 생성합니다.일반, 추론, 수학, 그래프 작성, OCR의 다섯 가지 범주를 포괄하는 고품질 시각적 추론 데이터 세트입니다.목표는 신뢰할 수 있고 견고한 시각적 추론에서 시각적 언어 모델에 대한 연구를 촉진하는 것입니다.