Command Palette
Search for a command to run...
DiP: 픽셀 공간에서의 확산 모델 제어하기
DiP: 픽셀 공간에서의 확산 모델 제어하기
Zhennan Chen Junwei Zhu Xu Chen Jiangning Zhang Xiaobin Hu Hanzhen Zhao Chengjie Wang Jian Yang Ying Tai
초록
확산 모델은 생성 품질과 계산 효율성 사이에 근본적인 트레이드오프를 겪는다. 잠재 공간 확산 모델(Latent Diffusion Models, LDMs)은 효율적인 해결책을 제시하지만, 정보 손실의 가능性和 엔드투엔드 학습이 불가능한 문제를 안고 있다. 반면 기존 픽셀 공간 모델은 VAE를 우회할 수 있지만 고해상도 생성에 있어 계산적으로 비현실적인 부담을 안고 있다. 이러한 딜레마를 해결하기 위해 우리는 효율적인 픽셀 공간 확산 프레임워크인 DiP를 제안한다. DiP는 생성 과정을 전역(global)과 국지(local) 단계로 분리한다: 대규모 패치를 대상으로 작동하는 확산 트랜스포머(Diffusion Transformer, DiT) 백본이 효율적인 전역 구조를 구성하고, 공동 학습된 가벼운 패치 디테일러 헤드(Patch Detailer Head)는 맥락 정보를 활용해 세부적인 국지적 디테일을 복원한다. 이러한 상호보완적 설계는 VAE에 의존하지 않으면서도 LDM 수준의 계산 효율성을 달성한다. DiP는 이전 방법 대비 최대 10배 빠른 추론 속도를 달성하면서 전체 파라미터 수는 단 0.3%만 증가시키며, ImageNet 256×256에서 1.90의 FID 점수를 기록하여 뛰어난 성능을 입증한다.