Command Palette
Search for a command to run...
MIRA: 이미지 편집을 위한 다중모달 반복 추론 에이전트
MIRA: 이미지 편집을 위한 다중모달 반복 추론 에이전트
Ziyun Zeng Hang Hua Jiebo Luo
초록
지시 기반 이미지 편집은 사용자가 자연어를 통해 이미지를 직관적으로 편집할 수 있는 방법을 제공한다. 그러나 기반 확산(diffusion-based) 편집 모델은 특히 조합적 관계, 맥락적 단서 또는 지시 표현(referring expressions)을 포함한 복잡한 사용자 지시를 정확히 해석하는 데 어려움을 겪어, 의미적 편차가 발생하거나 의도한 변경 사항을 반영하지 못하는 결과를 초래한다. 이 문제를 해결하기 위해 우리는 MIRA(Multimodal Iterative Reasoning Agent)를 제안한다. MIRA는 가벼우면서도 즉시 사용 가능한(multimodal reasoning agent)으로, 반복적인 인지-이해-행동(Perception-Reasoning-Action) 루프를 통해 편집을 수행함으로써, 다단계 인간-모델 상호작용 과정을 효과적으로 시뮬레이션한다. 단일 프롬프트나 정적 계획을 제출하는 대신, MIRA는 시각적 피드백을 활용해 원자적 편집 지시를 단계적으로 예측한다. 15만 개의 멀티모달 도구 사용 데이터로 구성된 MIRA-Editing 데이터셋과 이중 단계(SFT + GRPO) 훈련 파이프라인을 결합함으로써, MIRA는 복잡한 편집 지시에 대한 추론과 편집을 수행할 수 있다. 오픈소스 이미지 편집 모델인 Flux.1-Kontext, Step1X-Edit, Qwen-Image-Edit와 결합할 경우, MIRA는 의미적 일관성과 시각적 품질 측면에서 유의미한 향상을 보이며, GPT-Image나 Nano-Banana와 같은 프라이버시 시스템과 비교해도 우수하거나 이를 능가하는 성능을 달성한다.