HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-Pretraining-Code-v3 프로그래밍 코드 사전 학습 데이터셋

날짜

7일 전

조직

NVIDIA(英伟达)

Paper URL

arxiv.org

라이선스

CC BY 4.0

태그

Nemotron-Pretraining-Code-v3는 NVIDIA에서 대규모 언어 모델인 Nemotron 3 시리즈를 위해 제작한 코드 사전 학습 데이터셋 중 하나입니다. 이 데이터셋은 LLM(대규모 언어 모델)의 코드 이해, 생성, 완성 및 추론 능력을 향상시키는 것을 목표로 합니다. Nemotron-Pretraining-Code-v3는 NVIDIA Nemotron 사전 학습 데이터 시리즈의 코드 코퍼스 부분에 속합니다. 관련 논문으로는 "Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning"이 있습니다. 이 데이터 세트는 1억 4,630만 개의 파일로 구성되어 있습니다. 데이터 수집은 2025년 9월 30일에 종료되었습니다. 이 버전은 이전 버전과 비교하여 새로 추가된 소스 코드 파일만 포함하는 증분 버전입니다. 따라서 이전 버전과 비교해야 합니다. v1, v2 이들을 함께 사용하면 완전한 코드 사전 학습 코퍼스를 구성할 수 있습니다.

데이터 필드:

  • commit_id: Git 커밋 해시의 처음 7자리 문자입니다.
  • rel_path: 저장소의 루트 디렉터리에 있는 파일의 경로입니다.
  • 언어: 자동 탐지 및 인식을 위한 프로그래밍 언어.

소환

연구에 이 데이터셋을 사용하는 경우, 출처를 명시해 주시기 바랍니다. Nemotron 3 Ultra: 에이전트 추론을 위한 개방적이고 효율적인 전문가 혼합형 하이브리드 Mamba-Transformer 모델 .

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
Nemotron-Pretraining-Code-v3 프로그래밍 코드 사전 학습 데이터셋 | 데이터 세트 | HyperAI초신경