Command Palette
Search for a command to run...
DeepSeekMath-V2: 자가 검증 가능한 수학적 추론을 향하여
DeepSeekMath-V2: 자가 검증 가능한 수학적 추론을 향하여
Zhihong Shao Yuxiang Luo Chengda Lu Z.Z. Ren Jiewen Hu Tian Ye Zhibin Gou Shirong Ma Xiaokang Zhang
초록
대규모 언어 모델(Large Language Models, LLM)은 수학적 추론 분야에서 중요한 진전을 이루었으며, 이는 인공지능의 중요한 검증 환경이자, 향후 더욱 발전한다면 과학 연구에까지 영향을 미칠 수 있다. 강화학습을 활용해 정답을 올바르게 도출하는 것에 보상을 주는 방식으로 추론 능력을 확장함으로써, LLM은 단 일 년 만에 AIME 및 HMMT와 같은 정량적 추론 대회에서 낮은 성능에서부터 포화 상태에 도달할 정도로 성능을 향상시켰다. 그러나 이러한 접근법에는 근본적인 한계가 존재한다. 더 높은 최종 정답 정확도를 추구한다고 해도, 핵심적인 문제인 ‘정답이 올바른 추론을 의미하지는 않는다’는 점은 해결되지 않는다. 게다가 정리 증명과 같은 많은 수학적 과제는 수치적 답보다는 엄밀한 단계별 도출 과정을 요구하므로, 최종 정답에 대한 보상 구조는 적용하기 어렵다. 깊이 있는 추론 능력을 한계까지 끌어내기 위해서는, 수학적 추론의 포괄성과 엄밀성을 검증하는 것이 필수적이라고 본다. 특히, 해답이 알려지지 않은 개방형 문제에 대해 테스트 시 계산 자원을 확장할 때, 자기 검증(self-verification) 능력은 더욱 중요하다. 이러한 자기 검증 가능한 수학적 추론을 실현하기 위해, 우리는 정리 증명에 적합한 정확하고 신뢰할 수 있는 LLM 기반 검증 모델을 어떻게 훈련할 수 있는지 탐구한다. 이후 이 검증 모델을 보상 모델로 삼아 증명 생성 모델을 훈련하고, 생성 모델이 최종적으로 증명을 완성하기 전에 스스로 가능한 모든 문제점을 식별하고 해결하도록 유도한다. 생성 모델의 성능이 향상되면서 생성-검증 간 격차가 좁혀지는 것을 방지하기 위해, 우리는 검증 계산 자원을 확장하여 새로운 검증이 어려운 증명들을 자동으로 레이블링함으로써, 검증 모델의 성능 향상을 위한 추가 학습 데이터를 생성하는 방안을 제안한다. 이러한 방식으로 개발된 모델인 DeepSeekMath-V2는 강력한 정리 증명 능력을 보이며, 2025년 국제수학올림피아드(IMO 2025)와 2024년 중국수학올림피아드(CMO 2024)에서 금메달 수준의 성과를 기록했고, 확장된 테스트 시 계산 자원을 활용해 2024년 푸트넘 대회(Putnam 2024)에서 118/120의 거의 완벽한 점수를 기록했다. 아직 해결해야 할 과제는 많지만, 이러한 결과들은 자기 검증 가능한 수학적 추론이 실현 가능한 연구 방향임을 시사하며, 더 강력한 수학적 AI 시스템 개발에 기여할 수 있을 것으로 기대된다.