Command Palette
Search for a command to run...
Nemotron-Pretraining-Code-v3 프로그래밍 코드 사전 학습 데이터셋
Nemotron-Pretraining-Code-v3는 NVIDIA에서 대규모 언어 모델인 Nemotron 3 시리즈를 위해 제작한 코드 사전 학습 데이터셋 중 하나입니다. 이 데이터셋은 LLM(대규모 언어 모델)의 코드 이해, 생성, 완성 및 추론 능력을 향상시키는 것을 목표로 합니다. Nemotron-Pretraining-Code-v3는 NVIDIA Nemotron 사전 학습 데이터 시리즈의 코드 코퍼스 부분에 속합니다. 관련 논문으로는 "Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning"이 있습니다. 이 데이터 세트는 1억 4,630만 개의 파일로 구성되어 있습니다. 데이터 수집은 2025년 9월 30일에 종료되었습니다. 이 버전은 이전 버전과 비교하여 새로 추가된 소스 코드 파일만 포함하는 증분 버전입니다. 따라서 이전 버전과 비교해야 합니다. v1, v2 이들을 함께 사용하면 완전한 코드 사전 학습 코퍼스를 구성할 수 있습니다.
데이터 필드:
- commit_id: Git 커밋 해시의 처음 7자리 문자입니다.
- rel_path: 저장소의 루트 디렉터리에 있는 파일의 경로입니다.
- 언어: 자동 탐지 및 인식을 위한 프로그래밍 언어.
소환
연구에 이 데이터셋을 사용하는 경우, 출처를 명시해 주시기 바랍니다. Nemotron 3 Ultra: 에이전트 추론을 위한 개방적이고 효율적인 전문가 혼합형 하이브리드 Mamba-Transformer 모델 .