HyperAIHyperAI

Command Palette

Search for a command to run...

추론 코퍼스 대규모 모델 마인드 체인 데이터셋

날짜

조직

SupraLabs

라이선스

Apache 2.0

Reasoning Corpus는 SupraLabs에서 공개한 대규모 모델 사고 데이터셋으로, 주로 지도 미세 조정(SFT), 모델 정제 및 명령어 훈련에 사용됩니다. 이 데이터 세트는 약 5백만 개의 샘플로 구성되어 있으며, 각 시퀀스 길이는 5,000개 토큰으로 제한됩니다. 각 샘플에는 원래 사용자 프롬프트, 추론 과정, 최종 어시스턴트 응답, 출처 정보, 예상 토큰 길이 및 사전 포맷된 ChatML 표현이 포함됩니다. 데이터는 과학, 수학, 코딩, 논리적 추론, 금융 및 경제, 의학, 다국어 STEM 등 다양한 분야를 포괄하는 60개 이상의 공개 추론 데이터 웨어하우스에서 가져왔습니다. 또한 DeepSeek-v4, DeepSeek-r1, Qwen3, Gemma4와 같은 주요 대형 모델에서 생성된 사고 과정 데이터를 통합하고 있습니다.

데이터 필드:

  • repo_id: 상위 데이터 소스 저장소의 식별자
  • tok_len: 샘플 토큰 길이의 사전 계산된 추정치
  • 사용자: 원래 사용자 프롬프트 또는 작업 명령
  • thought_trace: 모델이 생성한 중간 추론 사고 과정
  • 조수: 최종 답은 추론 과정을 통해 도출되었습니다.
  • ChatML: 미리 서식이 지정된 표준 ChatML 형식 텍스트

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp