Command Palette
Search for a command to run...
자기지도 학습 강화학습을 위한 1000층 네트워크: 깊이를 확장함으로써 새로운 목표 도달 능력이 가능해질 수 있다
자기지도 학습 강화학습을 위한 1000층 네트워크: 깊이를 확장함으로써 새로운 목표 도달 능력이 가능해질 수 있다
Kevin Wang Ishaan Javali Michał Bortkiewicz Tomasz Trzcinski Benjamin Eysenbach
초록
자기지도 학습의 확장은 언어 및 비전 분야에서 획기적인 성과를 이끌었으나, 강화학습(RL) 분야에서는 유사한 진전이 여전히 이루어지지 못하고 있었다. 본 논문에서는 자기지도 강화학습(Self-supervised RL)을 위한 핵심 구성 요소를 탐구하며, 특히 네트워크 깊이가 확장성 향상에 결정적인 역할을 함을 입증한다. 최근 몇 년간 대부분의 강화학습 연구는 얕은 아키텍처(약 2~5층)에 의존해 왔으나, 본 연구에서는 깊이를 최대 1024층까지 증가시킴으로써 성능 향상이 상당히 가능함을 보여준다. 실험은 지시된 목표에 따라 탐색하는 비지도 설정에서 수행되며, 여기서는 지시나 보상이 제공되지 않으므로 에이전트는 처음부터 탐색을 시작하여 명령된 목표에 도달할 확률을 최대화하는 방법을 학습해야 한다. 시뮬레이션된 이동 및 조작 작업에서 평가한 결과, 본 연구의 접근법은 자기지도 대조 강화학습 알고리즘의 성능을 2배에서 최대 50배까지 향상시켰으며, 다른 목표 조건부 기반 알고리즘보다 우수한 성능을 보였다. 모델 깊이를 증가시키는 것은 성공률을 높이는 것 외에도, 학습된 행동의 질적 특성까지 변화시킨다.