Command Palette
Search for a command to run...
스케일링된 뷰전 브리지 트랜스포머
스케일링된 뷰전 브리지 트랜스포머
Zhenxiong Tan Zeqing Wang Xingyi Yang Songhua Liu Xinchao Wang
초록
우리는 조건부 생성을 위한 목적을 가진 대규모 브라운 운동 브리지 모델의 구현체인 비전 브리지 트랜스포머(Vision Bridge Transformer, ViBT)를 소개한다. 기존의 노이즈를 데이터로 변환하는 전통적인 확산 모델과 달리, 브리지 모델은 입력과 출력 사이의 경로를 직접 모델링함으로써 효율적인 데이터 간 번역 패러다임을 제안한다. 본 연구에서는 이러한 모델을 20B 및 1.3B 파라미터 규모로 확장하여 이미지 및 영상 번역 작업에서의 효과성을 입증하였다. 이와 같은 대규모 모델을 지원하기 위해 트랜스포머 아키텍처를 채택하였으며, 안정적인 학습을 위한 분산 안정화 속도 매칭 목적함수를 제안하였다. 이러한 기술적 진보들은 지시 기반 이미지 편집 및 복잡한 영상 번역 작업에서 브리지 모델의 확장 가능성을 강력하게 보여준다.