HyperAIHyperAI

Command Palette

Search for a command to run...

비디오 생성 모델은 우수한 잠재 보상 모델이다

초록

보상 피드백 학습(Reward Feedback Learning, ReFL)은 이미지 생성을 인간의 선호와 일치시키는 데 효과적임이 입증되었다. 그러나 영상 생성으로의 확장은 상당한 도전 과제를 안고 있다. 기존의 영상 보상 모델은 픽셀 공간 입력을 위한 시각-언어 모델에 기반하고 있어, ReFL 최적화를 계산 비용이 큰 VAE 복호화 이후 거의 완전한 노이즈 제거 단계로 제한한다. 이러한 픽셀 공간 기반 접근은 막대한 메모리 오버헤드와 긴 학습 시간을 초래하며, 조기 단계의 감독이 부족한 후기 단계 최적화를 통해 시각적 품질만 개선할 뿐, 본질적인 움직임 동역학과 구조적 일관성은 개선되지 않는다. 본 연구에서는 사전 훈련된 영상 생성 모델이 잡음이 있는 잠재 공간에서 보상 모델링에 자연스럽게 적합하다는 점을 입증한다. 이는 이러한 모델이 임의의 시점에서 잡음이 있는 잠재 표현을 처리하도록 명시적으로 설계되어 있으며, 순차적 모델링 능력을 통해 본질적으로 시간 정보를 보존하기 때문이다. 이를 바탕으로, 우리는 RGB ReFL에 비해 메모리 소비와 학습 시간을 크게 절감하면서 인간의 선호와의 일치도를 크게 향상시키는, 전적으로 잠재 공간에서 선호 최적화를 수행하는 프로세스 보상 피드백 학습(Process Reward Feedback Learning, PRFL) 프레임워크를 제안한다. 이는 VAE 복호화 없이도 전체 노이즈 제거 체인에 걸쳐 효율적인 기울기 역전파를 가능하게 한다. 광범위한 실험 결과는 PRFL이 인간 선호와의 일치도를 크게 개선함과 동시에 기존 RGB 기반 ReFL 대비 메모리 사용량과 학습 시간에서 상당한 감소를 달성함을 보여준다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
비디오 생성 모델은 우수한 잠재 보상 모델이다 | 문서 | HyperAI초신경