Video Generation Models: A Survey of Post-Training and Alignment
사전 학습된 비디오 생성 모델의 제어력과 신뢰성을 높이기 위한 포스트 트레이닝 및 정렬(Alignment) 기술의 체계적 분류와 방법론을 제시하는 서베이 논문입니다.
논문이 다루는 내용
비디오 생성 기술이 고해상도 및 장기 시퀀스 생성으로 발전했으나, 사전 학습된 모델은 여전히 인간의 의도 준수, 시간적 일관성 유지, 물리적 제약 충족 등에서 어려움을 겪습니다. 특히 비디오는 이미지와 달리 시간적 오류 누적과 움직임-외형 결합 문제로 인해 정렬 작업이 더욱 까다롭습니다. 본 논문은 이러한 문제를 해결하기 위한 포스트 트레이닝을 통합 프레임워크로 정의하고, 신호 부여 방식에 따라 암시적/명시적 정렬로 구분합니다. 기존 방법론을 지도 미세 조정, 자기 학습 및 증류, 선호도/보상 기반, 추론 시간 방법론의 네 가지 범주로 체계화했습니다. 이를 통해 제어 가능하고 신뢰할 수 있는 비디오 생성 모델 개발을 위한 개념적 토대와 실무적 가이드를 제공합니다.
핵심 결과
-
비디오 생성 특화 정렬(Alignment) 문제(시간적 일관성, 움직임 결합 등) 정의
-
포스트 트레이닝 방법론을 4가지 범주(SFT, Self-training, Preference-based, Inference-time)로 분류
-
데이터셋, 벤치마크 및 평가 방법론에 대한 포괄적 리뷰 제공
실무에서 볼 만한 점
사전 학습된 거대 비디오 모델을 밑바닥부터 다시 학습시키지 않고도, 특정 목적에 맞게 제어력을 높이는 최신 기법들을 파악할 수 있습니다.
읽을 때 확인할 점
-
현재 사용 중인 비디오 모델에 SFT(지도 미세 조정) 적용 시 성능 변화 관찰
-
RLHF(인간 피드백 기반 강화학습)와 같은 선호도 기반 정렬 기법의 비디오 적용 사례 검토
-
추론 시간(Inference-time) 최적화 기법을 통한 생성 품질 개선 실험