Command Palette
Search for a command to run...
Nemotron-SFT-SWE-v2 데이터셋
날짜
데이터 세트 소개
Nemotron-SFT-SWE-v2는 SWE-Bench 스타일 작업에서 대규모 언어 모델의 성능을 향상시키기 위해 설계된 소프트웨어 엔지니어링 명령어 미세 조정 데이터 세트입니다. 이 데이터 세트에는 OpenHands 프레임워크를 사용하여 수집된 에이전트 궤적과 코드 현지화, 코드 수정, 테스트 생성과 같은 하위 작업을 위한 에이전트가 없는 SWE 하위 집합이 포함되어 있습니다. 이 데이터셋은 주로 자율 소프트웨어 엔지니어링 에이전트 및 코드 어시스턴트를 개발하는 LLM 엔지니어 및 연구팀을 대상으로 하는 상업적 용도에 적합합니다. 지도 학습 기반 미세 조정 및 모델 정제에 적합하며, 모델이 실제 문제 상황을 해석하고, 다단계 도구 사용 계획을 수립하고, 코드베이스를 탐색하고, SWE-Bench 스타일 환경에서 수정 사항을 구현하는 데 도움을 줍니다.
데이터 세트 구성
부분집합
데이터 세트에는 두 개의 하위 집합이 포함되어 있습니다. – 지능형 에이전트의 SWE 궤적OpenHands 프레임워크를 사용하여 약 46,000개의 에이전트 궤적을 수집했습니다. 이 궤적들은 Qwen3-Coder-480B-A35B-Instruct를 사용하여 합성되었으며, SWE-Bench 작업에서 모델 성능을 향상시키기 위해 지도 학습 기반 미세 조정을 거쳐 신중하게 선별되었습니다. 문제 설명은 SWE-Gym 및 R2E-Gym-Subset에서 파생되었습니다. – 에이전트 없는 SWESWE-Bench 스타일의 에이전트리스 소프트웨어 엔지니어링 하위 작업(코드 위치 찾기, 코드 수정, 테스트 생성 등)에 대한 지도 학습 기반 미세 조정 데이터입니다. 각 예제에는 찾은 파일의 순위 목록, 수정된 패치, 테스트 생성 재현성 및 단위 테스트와 같은 작업별 출력 결과가 포함됩니다.
데이터 정량화
| 부분집합 | 표본 크기 |
|---|---|
| 에이전트리스_스웨 | 209,976 |
| 오픈핸즈_스웨 | 46,278 |
| 총 | 256,254 |
| 총 저장 공간은 약 17GB입니다. |
데이터 형식
양식: 텍스트 형식: JSONL 구조: 텍스트 + 메타데이터
특허
이 데이터 세트는 크리에이티브 커먼즈 저작자표시 4.0 국제(CC-BY 4.0) 라이선스에 따라 사용이 허가되었습니다. 기타 라이선스에는 Apache 2.0, MIT, BSD-3-Clause 및 BSD-2-Clause가 포함됩니다.