HyperAIHyperAI

Command Palette

Search for a command to run...

Agent0-VL: 도구 통합 시각-언어 추론을 위한 자가진화형 에이전트 탐색

Jiaqi Liu Kaiwen Xiong Peng Xia Yiyang Zhou Haonian Ji Lu Feng Siwei Han Mingyu Ding Huaxiu Yao

초록

시각-언어 에이전트는 다양한 다중모달 추론 과제에서 놀라운 진전을 이뤘으나, 여전히 인간 레이블링을 기반으로 한 감독 학습의 한계에 제약을 받고 있다. 최근의 자가 보상(self-rewarding) 접근법은 모델이 스스로 비평자 또는 보상 제공자 역할을 하도록 함으로써 이러한 제약을 극복하려는 시도를 하고 있다. 그러나 순수 텍스트 기반의 자가 평가는 복잡한 시각적 추론 과정을 검증하는 데 한계가 있으며, 종종 평가 환상(evaluation hallucinations)에 시달린다. 이러한 문제를 해결하기 위해, 도구 통합 추론의 최신 발전을 영감으로 삼아, 도구 통합 추론을 통해 지속적인 개선을 달성하는 자가 진화형 시각-언어 에이전트인 Agent0-VL을 제안한다. Agent0-VL은 도구 사용을 추론뿐 아니라 자가 평가와 자가 수리(self-repair)에도 통합함으로써, 모델이 증거 기반 분석을 통해 내면 탐색, 검증, 추론의 정교화를 수행할 수 있도록 한다. 이는 하나의 LVLM(Large Vision-Language Model) 내에서 두 가지 상호보완적인 역할을 통합한다: 다단계 도구 통합 추론을 수행하는 Solver(해결자)와 도구 기반 비평을 통해 구조화된 피드백과 세부적인 자가 보상을 생성하는 Verifier(검증자). 이 두 역할은 자기진화 추론 주기(Self-Evolving Reasoning Cycle)를 통해 상호작용하며, 도구 기반 검증과 강화 학습이 결합되어 추론과 평가 분포를 안정적으로 정렬함으로써 지속적인 자가 개선을 가능하게 한다. 외부 보상 없이도 작동하는 이 제로-외부 보상 진화 방식을 통해 Agent0-VL은 인간의 레이블링이나 외부 보상 모델 없이도 추론과 검증 행동을 자동으로 정렬하고, 지속적인 자가 개선을 달성한다. 기하학적 문제 해결 및 시각적 과학 분석에 대한 실험 결과에서 Agent0-VL은 기준 모델 대비 12.5%의 성능 향상을 달성하였다. 코드는 다음 URL에서 공개되어 있다: https://github.com/aiming-lab/Agent0/Agent0-VL


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
Agent0-VL: 도구 통합 시각-언어 추론을 위한 자가진화형 에이전트 탐색 | 문서 | HyperAI초신경