HyperAIHyperAI

Command Palette

Search for a command to run...

DiP: 픽셀 공간에서의 확산 모델 제어하기

Zhennan Chen Junwei Zhu Xu Chen Jiangning Zhang Xiaobin Hu Hanzhen Zhao Chengjie Wang Jian Yang Ying Tai

초록

확산 모델은 생성 품질과 계산 효율성 사이에 근본적인 트레이드오프를 겪는다. 잠재 공간 확산 모델(Latent Diffusion Models, LDMs)은 효율적인 해결책을 제시하지만, 정보 손실의 가능性和 엔드투엔드 학습이 불가능한 문제를 안고 있다. 반면 기존 픽셀 공간 모델은 VAE를 우회할 수 있지만 고해상도 생성에 있어 계산적으로 비현실적인 부담을 안고 있다. 이러한 딜레마를 해결하기 위해 우리는 효율적인 픽셀 공간 확산 프레임워크인 DiP를 제안한다. DiP는 생성 과정을 전역(global)과 국지(local) 단계로 분리한다: 대규모 패치를 대상으로 작동하는 확산 트랜스포머(Diffusion Transformer, DiT) 백본이 효율적인 전역 구조를 구성하고, 공동 학습된 가벼운 패치 디테일러 헤드(Patch Detailer Head)는 맥락 정보를 활용해 세부적인 국지적 디테일을 복원한다. 이러한 상호보완적 설계는 VAE에 의존하지 않으면서도 LDM 수준의 계산 효율성을 달성한다. DiP는 이전 방법 대비 최대 10배 빠른 추론 속도를 달성하면서 전체 파라미터 수는 단 0.3%만 증가시키며, ImageNet 256×256에서 1.90의 FID 점수를 기록하여 뛰어난 성능을 입증한다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
DiP: 픽셀 공간에서의 확산 모델 제어하기 | 문서 | HyperAI초신경