Command Palette
Search for a command to run...
강화학습이 기초 모델을 넘어서 대규모 언어 모델의 추론 능력을 진정으로 유인하는가?
강화학습이 기초 모델을 넘어서 대규모 언어 모델의 추론 능력을 진정으로 유인하는가?
Yang Yue Zhiqi Chen Rui Lu Andrew Zhao Zhaokai Wang Shiji Song Yang Yue Gao Huang
초록
최근 강화학습에 검증 가능한 보상(Reinforcement Learning with Verifiable Rewards, RLVR)을 도입한 기법이 대규모 언어모델(Large Language Models, LLMs)의 추론 성능 향상, 특히 수학 및 프로그래밍 과제에서 뚜렷한 성과를 보여주고 있다. 일반적으로, 기존의 강화학습이 에이전트가 탐색을 통해 새로운 전략을 학습하도록 돕는 것과 유사하게, RLVR는 LLM이 지속적으로 자기 개선을 가능하게 하여 기존 기저 모델(Baseline Model)의 능력 범위를 초월하는 새로운 추론 능력을 습득하게 한다는 믿음이 널리 퍼져 있다. 본 연구에서는 이러한 RLVR의 현재 상태를 체계적으로 검토하기 위해, 다양한 모델 패밀리, 강화학습 알고리즘, 그리고 수학·코딩·시각 추론 벤치마크를 대상으로 RLVR로 훈련된 LLM의 추론 능력 한계를 탐구하였으며, 평가 지표로는 큰 k 값에서의 pass@k를 사용하였다. 결과적으로, RLVR는 정답 경로를 향한 샘플링 효율성을 높이는 데에는 성공하지만, 예상과 달리 현재의 훈련 방식은 본질적으로 새로운 추론 패턴을 유도하지 못한다는 점을 발견하였다. 특히, k가 작을 때(예: k=1)는 RLVR 훈련된 모델이 기저 모델보다 우수한 성능을 보이지만, k가 커질수록 기저 모델이 더 높은 pass@k 점수를 기록하는 현상이 관찰되었다. 또한, RLVR 훈련이 진행될수록 LLM의 추론 능력 한계가 오히려 좁아지는 경향을 확인하였다. 추가적인 커버리지 및 혼란도 분석을 통해, RLVR 모델이 생성하는 추론 경로들이 기저 모델의 샘플링 분포 내에 이미 포함되어 있음을 확인하였으며, 이는 RLVR 모델의 추론 능력이 기저 모델의 내재된 능력에서 비롯되며, 그 범위에 제한됨을 시사한다. 이 관점에서 기저 모델을 상한선(upper bound)으로 간주할 경우, 정량적 분석을 통해 여섯 가지 대표적인 RLVR 알고리즘이 유사한 성능을 보이며, 기저 모델의 잠재력을 충분히 활용하지 못하고 있음을 밝혀냈다. 반면, 교사-학생 훈련(Distillation) 기법은 교사 모델로부터 새로운 추론 패턴을 도입함으로써 모델의 추론 능력을 진정으로 확장시킬 수 있음을 발견하였다. 종합적으로, 본 연구의 결과는 현재의 RLVR 기법이 LLM에 진정으로 새로운 추론 능력을 유도하는 데서 그 잠재력을 충분히 실현하지 못하고 있음을 시사한다. 이는 지속적 확장(continual scaling)과 다단계 에이전트-환경 상호작용을 포함한 개선된 강화학습 패러다임의 필요성을 강조하며, LLM의 추론 능력 향상 잠재력을 해방하기 위한 새로운 접근이 시급함을 시사한다.