HyperAI
Command Palette
Search for a command to run...
추론 코퍼스 대규모 모델 마인드 체인 데이터셋
Reasoning Corpus는 SupraLabs에서 공개한 대규모 모델 사고 데이터셋으로, 주로 지도 미세 조정(SFT), 모델 정제 및 명령어 훈련에 사용됩니다. 이 데이터 세트는 약 5백만 개의 샘플로 구성되어 있으며, 각 시퀀스 길이는 5,000개 토큰으로 제한됩니다. 각 샘플에는 원래 사용자 프롬프트, 추론 과정, 최종 어시스턴트 응답, 출처 정보, 예상 토큰 길이 및 사전 포맷된 ChatML 표현이 포함됩니다. 데이터는 과학, 수학, 코딩, 논리적 추론, 금융 및 경제, 의학, 다국어 STEM 등 다양한 분야를 포괄하는 60개 이상의 공개 추론 데이터 웨어하우스에서 가져왔습니다. 또한 DeepSeek-v4, DeepSeek-r1, Qwen3, Gemma4와 같은 주요 대형 모델에서 생성된 사고 과정 데이터를 통합하고 있습니다.
데이터 필드:
- repo_id: 상위 데이터 소스 저장소의 식별자
- tok_len: 샘플 토큰 길이의 사전 계산된 추정치
- 사용자: 원래 사용자 프롬프트 또는 작업 명령
- thought_trace: 모델이 생성한 중간 추론 사고 과정
- 조수: 최종 답은 추론 과정을 통해 도출되었습니다.
- ChatML: 미리 서식이 지정된 표준 ChatML 형식 텍스트
이 데이터셋은 커뮤니티 사용자가 기여한 것이며 교육 및 정보 제공 목적으로만 사용됩니다. 저작권 침해와 관련된 콘텐츠가 있는 경우 [email protected]로 문의하시면 신속하게 검토 및 삭제 처리하겠습니다.