Command Palette
Search for a command to run...
iMontage: 통합적이고 다용도이며 고도로 동적인 다대다 이미지 생성
iMontage: 통합적이고 다용도이며 고도로 동적인 다대다 이미지 생성
초록
사전 훈련된 비디오 모델은 고품질이고 시간적으로 일관된 콘텐츠를 생성하기 위한 강력한 사전 지식(prior)을 학습한다. 이러한 모델은 시간적 일관성 측면에서 뛰어나지만, 훈련 데이터의 연속적 성격으로 인해 동적 표현이 제한되는 경우가 많다. 우리는 이미지 데이터에서 얻은 풍부하고 제약 없는 콘텐츠 다양성을 시간적으로 일관된 프레임워크에 통합함으로써, 자연스러운 전이와 더 넓은 동적 범위를 갖춘 이미지 집합을 생성할 수 있을 것이라고 가정한다. 이를 위해 우리는 강력한 비디오 모델을 통합형 이미지 생성기로 재활용할 수 있도록 설계된 iMontage라는 통합 프레임워크를 제안한다. 이 프레임워크는 길이가 가변적인 이미지 집합을 입력받고 출력하며, 다양한 이미지 생성 및 편집 작업을 통합적으로 처리할 수 있다. 이를 달성하기 위해 간결하면서도 최소한의 개입을 가지는 적응 전략을 제안하고, 맞춤형 데이터 정제 과정과 훈련 패러다임을 함께 도입한다. 이러한 접근은 모델이 원래의 귀중한 운동 사전 지식을 손상시키지 않은 채 광범위한 이미지 조작 능력을 습득할 수 있도록 한다. iMontage는 여러 주류의 ‘다수 입력-다수 출력’ 작업에서 뛰어난 성능을 발휘하며, 이미지 간의 강력한 맥락 일관성을 유지하는 동시에 기존 범위를 초월한 놀라운 동적 장면을 생성한다. 홈페이지는 아래 링크에서 확인할 수 있다: https://kr1sjfu.github.io/iMontage-web/.