HyperAIHyperAI

Command Palette

Search for a command to run...

Multi-Agent Deep Research: M-GRPO를 활용한 Multi-Agent 시스템 훈련

초록

멀티 에이전트 시스템은 일반적인 추론 과제에서 우수한 성능을 발휘한다. 그러나 특화 영역에서의 훈련 부족은 정확성 저하를 야기한다. 현재의 훈련 방식은 시스템 내 모든 에이전트를 위해 단일 대규모 언어 모델(LLM)을 훈련한다. 이는 서로 다른 에이전트들의 배경 분포 차이에 기인한 성능 저하를 초래할 수 있다. 따라서 서로 다른 LLM을 사용하는 멀티 에이전트 시스템의 훈련은 해결해야 할 다음 단계이다. 그러나 이러한 접근 방식은 최적화상의 과제를 수반한다. 예를 들어, 에이전트들이 서로 다른 주파수로 작동하며, 롤아웃(rollout) 과정에서 하위 에이전트(sub-agent) 호출 횟이가 다양하고, 에이전트들이 대체로 별도의 서버에 배포되어 엔드 투 엔드(end-to-end) 그래디언트 흐름이 방해받는 문제가 있다.이러한 문제들을 해결하기 위해, 우리는 주요 에이전트(planner)와 여러 하위 에이전트(multi-turn tool executors)로 구성된 수직적(vertical) 멀티 에이전트 시스템을 대상으로 설계된 그룹 상대적 정책 최적화(Group Relative Policy Optimization, GRPO)의 계층적 확장 버전인 M-GRPO를 제안한다. M-GRPO는 주요 에이전트와 하위 에이전트 모두에 대해 그룹 상대적 이점(group-relative advantages)을 계산하여 계층적 크레딧 할당(hierarchical credit assignment)을 유지한다. 또한, 가변적인 하위 에이전트 호출에도 불구하고 고정된 크기의 배치(batch)를 생성하는 트래젝토리 정렬(trajecotry-alignment) 방식을 도입한다. 우리는 에이전트들이 별도의 서버에서 실행되고 공유 저장소를 통해 최소한의 통계 정보만 교환하는 분리형 훈련 파이프라인(decoupled training pipeline)을 배치한다. 이를 통해 서버 간 역전파(cross-server backpropagation) 없이도 확장 가능한 훈련이 가능하다. 실제 벤치마크(benchmark)에서의 실험 결과,


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
Multi-Agent Deep Research: M-GRPO를 활용한 Multi-Agent 시스템 훈련 | 문서 | HyperAI초신경