Command Palette
Search for a command to run...
REASONEDIT: 추론 강화 이미지 편집 모델을 향해
REASONEDIT: 추론 강화 이미지 편집 모델을 향해
초록
최근 이미지 편집 모델의 발전은 놀라운 성과를 보여주고 있다. 일반적인 아키텍처 설계는 다중모달 대규모 언어 모델(MLLM) 인코더와 확산 디코더를 결합하는 방식으로, Step1X-Edit 및 Qwen-Image-Edit와 같은 시스템에서 확인할 수 있다. 이들 시스템에서는 MLLM이 참조 이미지와 지시사항을 모두 인코딩하지만, 학습 중에는 고정된 상태를 유지한다. 본 연구에서는 MLLM의 추론 능력을 해제함으로써 편집 모델의 한계를 더욱 확장할 수 있음을 입증한다. 구체적으로, 지시사항 이해와 편집 정확도를 향상시키는 두 가지 추론 메커니즘—사고(thinking)와 반성(reflection)—을 탐구한다. 이를 기반으로 제안하는 프레임워크는 사고-편집-반성 루프를 통해 이미지 편집을 수행한다. 사고 메커니즘은 MLLM의 세계 지식을 활용하여 추상적인 지시사항을 해석하고, 반성 메커니즘은 편집 결과를 검토하여 의도하지 않은 조작을 자동으로 수정하며, 편집 종료 라운드를 식별한다. 광범위한 실험을 통해 제안한 추론 기반 접근법이 상당한 성능 향상을 달성함을 입증하였으며, Step1X-Edit(ReasonEdit-S)에서 DiT를 초기화한 경우 ImgEdit(+4.3%), GEdit(+4.7%), Kris(+8.2%)의 성능 향상을 기록하였다. 또한 Qwen-Image-Edit(ReasonEdit-Q)와 통합할 경우, GEdit 및 Kris에서 이전의 오픈소스 방법들을 모두 상회하는 성능을 보였다.