HyperAIHyperAI

Command Palette

Search for a command to run...

Canvas-to-Image: 다중모달 제어를 통한 구성적 이미지 생성

Yusuf Dalva Guocheng Gordon Qian Maya Goldenberg Tsai-Shien Chen Kfir Aberman Sergey Tulyakov Pinar Yanardag Kuan-Chieh Jackson Wang

초록

현대의 확산 모델은 높은 품질과 다양성을 갖춘 이미지를 생성하는 데 뛰어나지만, 특히 사용자가 텍스트 프롬프트, 주제 참조, 공간 배치, 자세 제약, 레이아웃 애너테이션을 동시에 지정할 때 고정밀한 조합적 및 다중 모달 제어를 수행하는 데 여전히 어려움을 겪고 있다. 본 연구에서는 이러한 다양한 제어를 하나의 캔버스 인터페이스로 통합하는 통합적 프레임워크인 Canvas-to-Image를 제안한다. 이는 사용자의 의도를 정확히 반영하는 이미지를 생성할 수 있도록 한다. 본 연구의 핵심 아이디어는 다양한 제어 신호를 하나의 복합 캔버스 이미지로 인코딩하여, 모델이 이를 직접 해석하고 통합적인 시각-공간적 추론을 수행할 수 있도록 하는 것이다. 또한, 다중 작업용 데이터셋을 체계적으로 구축하고, 다중 작업 캔버스 학습(Multi-Task Canvas Training) 전략을 제안함으로써, 확산 모델이 통합된 학습 프레임워크 내에서 텍스트 기반 이미지 생성 과정에서 이질적인 제어를 동시에 이해하고 통합하도록 최적화한다. 이러한 공동 학습은 특정 작업에 특화된 히ュ리스틱에 의존하지 않고, 여러 제어 모달 간의 종합적 추론을 가능하게 하며, 추론 시 다중 제어 상황에 대해 우수한 일반화 성능을 보인다. 광범위한 실험 결과는 Canvas-to-Image가 다인물 조합, 자세 제어 조합, 레이아웃 제약 생성, 다중 제어 생성 등 다양한 도전적인 벤치마크에서 상태 최신 기법보다 정체성 유지 및 제어 준수 측면에서 뚜렷한 성능 우위를 보임을 확인하였다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
Canvas-to-Image: 다중모달 제어를 통한 구성적 이미지 생성 | 문서 | HyperAI초신경