HyperAIHyperAI

Command Palette

Search for a command to run...

스케일링된 뷰전 브리지 트랜스포머

Zhenxiong Tan Zeqing Wang Xingyi Yang Songhua Liu Xinchao Wang

초록

우리는 조건부 생성을 위한 목적을 가진 대규모 브라운 운동 브리지 모델의 구현체인 비전 브리지 트랜스포머(Vision Bridge Transformer, ViBT)를 소개한다. 기존의 노이즈를 데이터로 변환하는 전통적인 확산 모델과 달리, 브리지 모델은 입력과 출력 사이의 경로를 직접 모델링함으로써 효율적인 데이터 간 번역 패러다임을 제안한다. 본 연구에서는 이러한 모델을 20B 및 1.3B 파라미터 규모로 확장하여 이미지 및 영상 번역 작업에서의 효과성을 입증하였다. 이와 같은 대규모 모델을 지원하기 위해 트랜스포머 아키텍처를 채택하였으며, 안정적인 학습을 위한 분산 안정화 속도 매칭 목적함수를 제안하였다. 이러한 기술적 진보들은 지시 기반 이미지 편집 및 복잡한 영상 번역 작업에서 브리지 모델의 확장 가능성을 강력하게 보여준다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
스케일링된 뷰전 브리지 트랜스포머 | 문서 | HyperAI초신경