HyperAIHyperAI

Command Palette

Search for a command to run...

데이터셋 개요 | NVIDIA, Nemotron 데이터셋 공개: 10TB 이상의 토큰과 4천만 개의 학습 샘플을 포함하며, 수학적 추론, 코드 생성 및 다국어 대화 학습을 지원합니다.

Featured Image

대규모 모델 경쟁에서 훈련 데이터는 핵심 변수로 자리 잡고 있습니다. 매개변수 개수만이 유일한 장벽이 아닌 상황에서, 데이터의 품질, 구조, 그리고 작업 적합성은 추론, 코드, 상호작용 등 다양한 측면에서 모델의 진정한 성능을 결정짓는 중요한 요소가 되었습니다.

NVIDIA의 Nemotron 데이터셋 시리즈는 이러한 추세에 대응하여 구축된 데이터 리소스 시스템입니다. 이 시스템은 10TB 이상의 토큰과 4천만 개의 학습 후 샘플을 포함하며, 기본 모델부터 에이전트 워크플로에 이르기까지 전체 학습 수명 주기를 포괄합니다.규모에만 초점을 맞추는 기존의 사전 학습 데이터와 달리, 네모트론 시리즈는 다양한 기능 차원을 목표로 하는 데이터셋을 제공하며, 각 데이터셋은 모델 기능 구축의 특정 측면에 대응합니다.

이 글에서는 현재 대규모 모델 훈련의 핵심 기능들을 다루는 15개의 네모트론 데이터셋을 정리했습니다.일반 텍스트 사전 학습, 지도형 미세 조정(SFT), 코드 생성, 수학적 추론 및 다국어 페르소나 대화 데이터.이는 기본적인 역량 구축부터 과제 역량 최적화에 이르기까지 모델에 대한 체계적인 데이터 지원을 제공합니다.

이러한 데이터셋의 설계 철학은 명확한 변화를 보여줍니다. 대규모 모델 학습이 "더 많은 데이터로 더 강력한 모델을 학습시키는 것"에서 "더 정확한 데이터로 더 적합한 모델을 학습시키는 것"으로 전환되고 있는 것입니다. 네모트론 시리즈의 접근 방식은 이러한 추세를 단적으로 보여주는 사례입니다. 즉, 학습 데이터를 설계하는 능력이 모델 성능의 한계를 결정하는 핵심 변수가 되고 있다는 뜻입니다.

다음 데이터 세트는 모두 HyperAI(hyper.ai)에 포함되어 있으며, 대규모 모델 연구원 및 개발자를 위한 체계적인 데이터 리소스 참조 자료를 제공하고자 합니다.

더욱 고품질의 데이터 세트:

https://hyper.ai/datasets

데이터셋 추천

1. Nemotron-CC-v2 사전 학습 데이터셋

* 온라인에서 사용하세요:

https://go.hyper.ai/KbOSx

Nemotron-CC-v2는 NVIDIA가 2025년에 출시한 Nemotron-CC의 후속 버전입니다. 관련 논문의 제목은 "NVIDIA Nemotron Nano 2: 정확하고 효율적인 하이브리드 Mamba-Transformer 추론 모델"입니다. 

이 데이터셋은 기존 영어 웹 코퍼스를 기반으로 2024년부터 2025년까지의 8개 Common Crawl 스냅샷을 추가하고, 글로벌 중복 제거 및 영어 필터링을 수행하여 구축되었습니다. 또한 Qwen3-30B-A3B를 사용하여 웹 콘텐츠를 합성하고 재구성하고, 다양한 질의응답(Diverse QA)을 보완하며, 다국어 논리적 추론 및 일반 지식 사전 학습을 강화하기 위해 15개 언어로 추가 번역했습니다. 이 데이터셋의 의의는 "고품질 영어 웹페이지 → 종합된 다양한 QA"라는 효과적인 접근 방식을 한 단계 발전시켜, 최신 웹 크롤링과 다국어 확장을 체계적인 접근 방식으로 결합하는 데 있습니다. 엄격한 중복 제거, 필터링 및 재현 가능한 배포를 통해 다양한 사전 학습 파이프라인에 직접 통합할 수 있습니다.

2. 네모트론 사전학습-SFT 지도 미세조정 데이터셋

* 온라인에서 사용하세요:

https://go.hyper.ai/nF9Hl

Nemotron-Pretraining-SFT-v1은 NVIDIA가 2025년에 발표한 합성 생성 데이터셋입니다. 관련 논문은 "NVIDIA Nemotron Nano 2: 정확하고 효율적인 하이브리드 Mamba-Transformer 추론 모델"로, 명령어 따르기, 추론, 코드 작성 및 일반적인 질의응답과 같은 작업에서 모델의 성능을 향상시키는 것을 목표로 합니다. 

이 데이터셋은 STEM, 학술, 논리적 추론 및 다국어 환경을 위해 설계되었습니다. 고품질의 수학 및 과학 자료를 기반으로 확장되었으며, 대학원 수준의 학술 텍스트와 정밀하게 조정된 SFT 데이터를 결합하여 수학, 코딩, 일반 지식, 논리적 추론 등 다양한 과제를 포괄하는 복잡한 객관식 및 분석적 문제(완전한 해답/접근 방식 포함)를 구성했습니다. 네모트론 사전 학습 데이터의 공식 통계에서 SFT 관련 범주(예: 수학 SFT, 코딩 SFT, 일반 SFT)가 상당한 비중을 차지하므로 사용자는 메타데이터를 기반으로 필요한 하위 집합을 쉽게 필터링하여 재현 가능한 실험을 수행할 수 있습니다.

3. 네모트론 사전학습 코드 데이터셋

* 온라인에서 사용하세요:

https://go.hyper.ai/37WQG

Nemotron-Pretraining-Code-v1은 GitHub에 구축되어 NVIDIA가 2025년에 공개한, 신중하게 선별된 대규모 코드 데이터셋입니다. 관련 논문은 "NVIDIA Nemotron Nano 2: 정확하고 효율적인 하이브리드 맘바-트랜스포머 추론 모델"입니다.

다단계 중복 제거, 라이선스 준수 및 휴리스틱 품질 검사를 거쳐 필터링된 이 데이터 세트는 11개 프로그래밍 언어에 대한 LLM 생성 코드 질문-답변 쌍을 포함합니다. 175.1B의 고품질 합성 코드 토큰 외에도, 사용자의 재현을 용이하게 하기 위한 메타데이터(약 747.4B 토큰)도 포함되어 있습니다.

4. Nemotron-Pretraining-Code 사전 학습 데이터셋

* 온라인에서 사용하세요:

https://go.hyper.ai/QcGUu

Nemotron-Pretraining-Code-v3는 NVIDIA에서 대규모 언어 모델인 Nemotron 3 시리즈를 위해 제작한 코드 사전 학습 데이터셋 중 하나입니다. 이 데이터셋은 LLM(대규모 언어 모델)의 코드 이해, 생성, 완성 및 추론 능력을 향상시키는 것을 목표로 합니다. Nemotron-Pretraining-Code-v3는 NVIDIA Nemotron 사전 학습 데이터 시리즈의 코드 코퍼스 부분에 속합니다. 관련 논문으로는 "Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning"이 있습니다. 

이 데이터셋은 총 1억 4,630만 개의 파일로 구성되어 있습니다. 데이터 수집은 2025년 9월 30일에 종료되었습니다. 이 데이터셋은 이전 버전과 비교하여 이번 시리즈에 추가된 소스 코드 파일만 포함하는 증분 버전입니다. 완전한 코드 사전 학습 코퍼스를 구성하려면 v1 및 v2와 함께 사용해야 합니다.

5. 네모트론-CC-수학 수학 사전 학습 데이터셋

* 온라인에서 사용하세요:

https://go.hyper.ai/6jNCq

데이터셋 구축 과정

Nemotron-CC-Math는 NVIDIA와 보스턴 대학교가 2025년에 발표한 수학 분야에 특화된 고품질 대규모 사전 학습 데이터셋입니다. 관련 논문은 "Nemotron-CC-Math: 1330억 토큰 규모의 고품질 수학 사전 학습 데이터셋"입니다. 이 데이터셋은 가치 있는 수학 및 코드 콘텐츠를 보존하고 표현함으로써 차세대 지능형 글로벌 언어 모델 개발을 촉진하는 것을 목표로 합니다. 

이 데이터셋은 1330억 개의 토큰을 포함하며, NVIDIA Lynx와 경량 LLM(LaTeX Model) 기반의 추출 및 정규화 파이프라인을 사용하여 Common Crawl에서 구축되었습니다. 방정식 및 코드 형식 구조를 유지하면서 수학적 콘텐츠를 편집 가능한 LaTeX 형식으로 통합하여 웹 규모에서 최초로 다양한(수집형 및 소수의) 수학적 형식을 지원합니다. 이러한 장점은 여러 벤치마크를 통해 검증되었습니다.

6. 네모트론-페르소나-코리아 (한국 합성인간 데이터셋)

* 온라인에서 사용하세요:

https://go.hyper.ai/49T4h

Nemotron-Personas-Korea는 한국인의 다양성과 특성을 종합적으로 반영하도록 설계된, NVIDIA가 2026년에 공개한 한국어 합성 캐릭터 데이터셋입니다. 이 데이터셋은 최초의 대규모 한국어 합성 캐릭터 데이터셋으로, 주로 Sovereign AI 합성 데이터의 다양성을 확장하고, 데이터 및 모델 편향을 완화하며, 모델 반응의 다양성을 향상시키는 데 사용됩니다. 

이 데이터 세트는 각각 7개의 가상 캐릭터를 포함하는 100만 개의 레코드로 구성되어 있으며, 총 약 700만 개의 캐릭터 설명과 약 17억 개의 토큰을 포함하고 있습니다. 이 중 10억 개의 토큰은 캐릭터와 관련되어 있습니다. 데이터는 대한민국 17개 광역 자치구와 252개 시/군을 대상으로 하며, 총 209,167개의 고유한 이름이 포함되어 있습니다. 이 데이터 세트는 한국 통계청(KOSIS), 대법원, 국민건강보험공단, 한국농촌경제연구원, 네이버 클라우드에서 제공한 공식 정보를 기반으로 생성되었습니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 아무런 관련이 없습니다. 또한 19세 미만 미성년자의 데이터는 제외되었습니다.

7. 네모트론 페르소나 프랑스 (프랑스 합성 인간 데이터셋)

* 온라인에서 사용하세요:

https://go.hyper.ai/gCJBP

Nemotron Personas France는 NVIDIA가 Pleias와 협력하여 2026년에 공개한 프랑스 가상 캐릭터 데이터셋입니다. 이 데이터셋은 실제 프랑스의 인구 통계, 지리 및 성격 특성을 기반으로 생성된 가상 캐릭터 데이터를 포함합니다. 목표는 프랑스의 지리적 및 인구 통계학적 분포를 반영하여 모델 개발을 지원하는 다양한 가상 캐릭터 데이터를 제공하는 것입니다. 

이 데이터 세트는 100만 개의 레코드에 걸쳐 분포된 600만 명의 프랑스인 정보를 포함합니다. 각 레코드는 이름, 성별, 나이, 결혼 여부, 직업 등 22개의 필드를 제공하며, 학자, 스포츠 애호가, 예술 애호가, 음식 애호가, 여행 애호가 등 다양한 유형의 사람들을 포함합니다.

8.Nemotron-Personas-Brazil 브라질 합성 캐릭터 데이터셋

* 온라인에서 사용하세요:

https://go.hyper.ai/9MYxx

Nemotron-Personas-Brazil은 NVIDIA가 WideLabs와 협력하여 2026년에 공개한 브라질 인구를 위한 합성 캐릭터 데이터셋입니다. 이 데이터셋은 브라질 인구의 다양성과 풍부함을 보여줌으로써 지역적 다양성(북부, 북동부, 중서부 등), 민족적 배경, 교육 수준, 직업 분포 등 다차원적인 잠재적 인구 분포를 보다 포괄적으로 반영하는 것을 목표로 합니다. 

이 데이터 세트는 각각 6개의 복합 문자를 포함하는 100만 개의 레코드로 구성됩니다. 각 레코드는 6개의 문자 필드와 14개의 컨텍스트 필드로 이루어져 있으며, 컨텍스트 필드는 브라질의 공식 인구 구조 및 노동 시장 분포를 기반으로 통계적으로 구성되었습니다. 이 데이터는 브라질의 26개 주와 연방 직할구의 지리적 및 인구 통계학적 분포를 포괄합니다.

9.네모트론 페르소나스 USA(미국) 성격 데이터 세트

* 온라인에서 사용하세요:

https://go.hyper.ai/VkjC8

Nemotron-Personas-USA는 NVIDIA에서 2025년에 공개한 대규모 합성 사용자 프로필 데이터셋입니다. 이 데이터셋은 대화 생성, 페르소나 시뮬레이션, 사용자 모델링, 다양한 행동 분석과 같은 작업에서 대규모 언어 모델(LLM) 및 지능형 에이전트 시스템의 학습 및 평가를 지원하는 것을 목표로 합니다. 약 100만 개의 가상 인물 기록과 총 600만 개의 페르소나 필드, 16개의 상황 정보 필드를 포함하고 있습니다. 미국 50개 주와 푸에르토리코, 버진 아일랜드를 아우르며 29,000개의 우편번호(ZCTA)와 15,200개의 도시/지역을 포괄하여 미국 인구의 지리적 및 사회적 분포를 비교적 완벽하게 반영합니다. 

이 데이터 세트는 약 97만 개의 고유 이름을 포함하고 있으며 560개 이상의 직업 범주를 포괄합니다. 직업 분포는 실제 직업 통계를 참조하여 우수한 사회적 대표성을 보장합니다. 각 데이터 포인트는 연령, 성별, 교육 수준, 소득, 직업, 위치와 같은 구조화된 인구 통계 정보와 관심사, 가치관, 라이프스타일, 개인 목표와 같은 자연어 페르소나 설명을 포함하는 다차원 필드로 구성되어 구조화된 정보와 비구조화된 텍스트를 결합한 복합 페르소나 표현을 형성합니다.

10. Nemotron-Personas-Japan: 일본인 합성 인간 형상 데이터 세트.

* 온라인에서 사용하세요:

https://go.hyper.ai/3oCJ3

Nemotron-Personas-Japan은 NVIDIA에서 2025년에 공개한 합성 인간 형상 데이터셋입니다. 일본 인구의 다양성과 풍요로움을 보여주는 것을 목표로 하며, 주로 자율적인 AI 시스템 개발, 대규모 언어 모델 학습, 합성 데이터의 편향 감소 등을 지원하는 데 사용됩니다. 

이 데이터 세트는 각각 6개의 가상 캐릭터를 포함하는 100만 개의 레코드로 구성되어 있으며, 총 약 600만 개의 캐릭터 설명과 약 14억 개의 토큰을 포함하고 있습니다. 이 중 8억 5천만 개의 토큰은 캐릭터와 관련되어 있습니다. 데이터는 일본의 47개 현 전체, 1,500개 이상의 직업군, 그리고 95만 개 이상의 고유 이름을 포괄합니다. 이 데이터 세트는 일본의 공식 인구 통계 데이터, 지리적 분포 및 성격 특성 분포를 기반으로 생성되었습니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 아무런 관련이 없습니다. 또한 18세 미만 미성년자의 데이터는 제외되었습니다. 

11. Nemotron-Personas-India: 인도 출신의 합성 인간 형상 데이터 세트.

* 온라인에서 사용하세요:

https://go.hyper.ai/lT28T

Nemotron-Personas-India는 NVIDIA에서 2025년에 공개한 인도 기반의 합성 인간 데이터셋입니다. 이 데이터셋은 인도의 실제 지리적 및 인구 통계학적 분포를 반영하여 합성 데이터의 다양성을 향상시키고, 모델 편향을 줄이며, 모델 붕괴를 방지하는 것을 목표로 합니다. 주로 인도의 모델 개발자들이 지역적 특성과 문화적 배경을 통합할 수 있는 독자적인 AI 시스템을 구축하는 데 도움을 주기 위해 사용됩니다. 

이 데이터 세트는 각각 7개의 가상 캐릭터 역할을 가진 300만 개의 레코드로 구성되어 있으며, 총 약 2,100만 개의 캐릭터 설명과 약 77억 개의 토큰을 포함합니다. 이 중 29억 개의 토큰은 캐릭터 관련 정보입니다. 데이터는 인도의 36개 주 및 연방 직할령, 640개 행정 구역을 포괄하며, 약 56만 개의 고유 이름을 포함합니다. 영어, 데바나가리 문자, 라틴어의 세 가지 언어 버전으로 제공되며, 각 언어 버전별로 약 100만 개의 레코드가 있습니다. 이 데이터 세트는 2011년 인도 인구 조사 및 선거인 명부의 실제 인구 통계 및 지리적 분포 정보를 기반으로 합니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 무관합니다. 또한 18세 미만 미성년자의 데이터는 제외되었습니다.

12. Nemotron-Personas-Belgium (벨기에 합성 인간 데이터 세트)

* 온라인에서 사용하세요:

https://go.hyper.ai/epZ5X

Nemotron-Personas-Belgium은 NVIDIA가 Pleias 및 KU Leuven과 협력하여 2026년에 공개한 벨기에 출신 합성 인간 데이터 세트입니다. 이 데이터 세트는 벨기에 인구의 다양성과 특성을 종합적으로 반영하여, 주권 AI 합성 데이터의 다양성을 확대하고, 데이터 및 모델 편향을 완화하며, 모델 응답의 다양성을 향상시키는 것을 목표로 합니다. 

이 데이터 세트는 120만 개의 레코드로 구성되어 있으며, 각 레코드에는 6개의 가상 캐릭터 역할이 포함되어 있습니다. 총 약 180만 개의 캐릭터 설명과 약 19억 개의 토큰으로 이루어져 있으며, 그중 8억 6,700만 개의 토큰은 캐릭터 관련 정보입니다. 데이터는 벨기에 581개 지방 자치 단체와 3개 행정 구역을 대상으로 하며, 약 26만 개의 고유한 이름을 포함합니다. 네덜란드어, 프랑스어, 독일어, 영어의 4개 언어로 제공되며, 각 언어 버전별로 30만 개의 레코드가 포함되어 있습니다. 이 데이터 세트는 벨기에 2021년 인구 조사 데이터와 2025년 인구 구조 데이터를 기반으로 합니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 무관합니다. 또한 18세 미만 미성년자의 데이터는 제외되었습니다.

13. Nemotron-Personas-Vietnam: 합성된 베트남인 데이터셋.

* 온라인에서 사용하세요:

https://go.hyper.ai/g7Msj

Nemotron-Personas-Vietnam은 NVIDIA에서 2026년에 공개한 베트남인 가상 데이터셋입니다. 베트남 인구의 다양성과 특성을 종합적으로 반영하는 것을 목표로 하며, 주로 베트남 주권 관련 AI 모델 개발을 지원하고, 데이터 편향을 완화하며, 베트남 문화적 맥락에서 모델 반응의 다양성을 향상시키는 데 사용됩니다. 

이 데이터 세트는 각각 6개의 가상 캐릭터 역할을 가진 10만 개의 레코드로 구성되어 있으며, 총 약 60만 개의 캐릭터 설명과 약 1억 1,800만 개의 토큰을 포함합니다. 이 중 5,200만 개의 토큰은 캐릭터 관련 정보입니다. 데이터는 베트남의 6개 중앙 직할 시·도에 걸쳐 있으며, 약 13,000개의 고유한 이름을 포함합니다. 이 데이터 세트는 베트남 공식 통계와 FPT 그룹에서 제공한 현지 전문가 지식을 기반으로 생성되었습니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 무관합니다. 또한 18세 미만 미성년자에 대한 데이터는 제외되었습니다.

14. Nemotron-Personas El Salvador(살바도르 합성 인간 데이터 세트)

* 온라인에서 사용하세요:

https://go.hyper.ai/39ALO

NVIDIA가 2026년에 공개한 Nemotron-Personas-El Salvador 데이터셋은 엘살바도르 사람들을 가상으로 생성한 데이터셋입니다. 이 데이터셋은 엘살바도르 인구의 다양성과 특성을 종합적으로 반영하는 것을 목표로 하며, 주로 엘살바도르 주권 관련 AI 모델 개발을 지원하고, 데이터 편향을 완화하며, 엘살바도르 문화적 맥락 내에서 모델 반응의 다양성을 향상시키는 데 사용됩니다. 

이 데이터 세트는 총 148,000개의 레코드로 구성되어 있으며, 약 100만 개의 캐릭터 설명과 약 3억 개의 토큰을 포함합니다. 이 중 1억 6,100만 개의 토큰은 캐릭터 관련 정보입니다. 데이터는 엘살바도르의 14개 주와 44개 시를 대상으로 하며, 약 144,000개의 고유한 이름을 포함합니다. 이 데이터 세트는 엘살바도르의 2024년 제7차 전국 인구 조사와 제6차 전국 주택 조사에서 얻은 실제 인구 통계, 지리적 분포 및 직업 통계를 기반으로 합니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 무관합니다. 또한 18세 미만 미성년자의 데이터는 제외되었습니다.

15. 네모트론-페르소나스 싱가포르 (싱가포르 합성 인간 데이터셋)

* 온라인에서 사용하세요:

https://go.hyper.ai/84YYI

Nemotron-Personas-Singapore는 NVIDIA가 2026년에 공개한 싱가포르의 가상 인물 데이터셋입니다. 이 데이터셋은 싱가포르의 실제 인구, 지리적 특성 및 성격적 특징을 반영하도록 설계되었습니다. 주요 목적은 자율적인 AI 시스템 개발을 지원하고, 가상 데이터의 다양성을 향상시키며, 모델 편향을 완화하고, 모델 붕괴를 방지하는 것입니다. 

이 데이터 세트는 148,000개의 레코드로 구성되어 있으며, 각 레코드는 6개의 가상 캐릭터 역할을 포함하고 있습니다. 총 888,000개의 캐릭터 설명과 약 1억 1,800만 개의 토큰으로 이루어져 있으며, 이 중 4,800만 개의 토큰은 캐릭터 관련 정보입니다. 데이터는 싱가포르의 55개 계획 구역을 포괄하며, 약 146,000개의 고유한 이름을 포함합니다. 이 데이터 세트는 2024년 싱가포르 인구 조사, 국립도서관위원회(NLB)의 이름 사용 권한 데이터, 그리고 주택개발청(CEA)에서 제공한 공식 정보를 기반으로 생성되었습니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 무관합니다. 또한 18세 미만 미성년자에 대한 데이터는 제외되었습니다.