HyperAIHyperAI

Command Palette

Search for a command to run...

Nemotron-RL-Agentic-Terminal-Pivot-v1 터미널 에이전트 강화학습 데이터셋

날짜

조직

NVIDIA

라이선스

CC BY 4.0

Nemotron-RL-Agentic-Terminal-Pivot-v1은 NVIDIA가 2026년에 출시한 터미널 에이전트 강화 학습 데이터셋으로, 대규모 언어 모델(LLM)이 터미널(명령줄) 상호작용 시나리오를 위한 강화 학습 훈련 샘플을 사용할 수 있도록 설계되었습니다. 이 데이터셋은 NeMo Gym의 terminus_judge 환경을 위해 특별히 제작되었으며, 에이전트의 강화 학습 후학습(SFT), 지도 미세 조정 또는 행동 오프라인 분석에 활용할 수 있습니다.

해당 데이터셋에는 총 31,111개의 훈련 샘플이 포함되어 있으며, 이는 630개의 ATCB 시드 작업과 2,716개의 서로 다른 소스 궤적에서 파생되었습니다. 작업 시나리오는 산업 시스템, 고성능 컴퓨팅(HPC) 클러스터, 의료, 금융 및 미디어 아카이빙 등 다양한 분야의 장기적인 터미널 작업을 포괄하며, 여기에는 데이터 파이프라인 구축, 장애 감사, 서비스 진단 및 보안 규정 준수 프로세스 등이 포함됩니다. 각 작업별 샘플 중앙값은 45개이며, 모든 샘플은 최종 작업을 성공적으로 완료한 에이전트 궤적에서 추출된 단일 에이전트 의사 결정 지점입니다. 각 샘플에는 작업 프롬프트, GLM-5.1을 교사로 사용한 Terminus-2 에이전트가 생성한 다음 단계 참조 동작, 그리고 보상 점수 매핑을 위한 라우팅 정보가 포함됩니다. 여기서 작업 프롬프트의 평균 길이는 약 39,900자이고, 다음 단계 참조 동작의 평균 길이는 약 970자입니다.

데이터 필드:

  • responses_create_params.input: 작업 지침 및 의사 결정 지점 이전까지의 터미널 상호작용 역사를 포함한 프롬프트
  • expected_answer: 해당 시점에서 에이전트에 대한 참조용 다음 단계 동작
  • agent_ref: 정책 모델 동작 평가와 강화 학습 보상 생성을 위해 NeMo Gym terminus_judge 리소스 서버로 연결하는 라우팅 정보
  • metadata: 내부 수집 식별자와 인프라 정보를 제거한 메타데이터 객체로, 5개의 하위 필드를 포함함

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp