Command Palette
Search for a command to run...
AnyTalker: 상호작용 개선을 통한 다중 인물 대화 영상 생성의 확장
AnyTalker: 상호작용 개선을 통한 다중 인물 대화 영상 생성의 확장
초록
최근 들어 다중 인물 영상 생성 기술이 주목받기 시작하고 있다. 일부 초기 연구들은 음성 기반 다중 인물 대화 영상 생성을 탐구했지만, 다양한 다중 인물 데이터 수집의 높은 비용과 여러 인물의 정합성 있는 상호작용을 유도하는 어려움으로 인해 여전히 도전 과제에 직면해 있다. 이러한 문제를 해결하기 위해 우리는 확장 가능한 다중 스트림 처리 아키텍처를 특징으로 하는 AnyTalker라는 다중 인물 생성 프레임워크를 제안한다. 구체적으로, Diffusion Transformer의 어텐션 블록에 새로운 아이덴티티 인식 어텐션 메커니즘을 도입하여 아이덴티티-음성 쌍을 반복적으로 처리함으로써, 조작 가능한 인물 수를 임의로 확장할 수 있도록 했다. 또한 다중 인물 생성 모델의 학습에는 방대한 다중 인물 데이터가 요구되지만, 본 연구에서 제안하는 학습 파이프라인은 단일 인물 영상만을 활용하여 다중 인물의 발화 패턴을 학습하고, 실제 다중 인물 클립 몇 개만으로 상호작용을 보완적으로 개선한다. 더불어, 생성된 다중 인물 영상의 자연스러움과 상호작용 수준을 평가하기 위해 특화된 평가 지표와 데이터셋을 제안한다. 광범위한 실험을 통해 AnyTalker가 뛰어난 입술 동기화, 시각적 품질, 자연스러운 상호작용을 달성함으로써 데이터 비용과 인물 확장성 사이에서 유리한 균형을 이루고 있음을 입증하였다.