LongLive-Plug: Once-for-All Distillation for Video Generation
한 번의 증류(Distillation)로 다양한 하위 태스크 모델에 즉시 적용 가능한 재사용 가능한 LoRA 어댑터 프레임워크 제안
논문이 다루는 내용
최근 비디오 확산 모델은 다양한 하위 태스크를 위해 특화된 모델로 개발되며, 이 과정에서 샘플링 가속이나 긴 영상 생성을 위한 증류 단계가 반복적으로 수행되는 문제가 있습니다. 이를 해결하기 위해 본 논문은 'LongLive-Plug'라는 Once-for-all 증류 프레임워크를 제안합니다. 이 방식은 베이스 모델에 재사용 가능한 능력을 LoRA 형태로 학습시켜, 추가 학습 없이 호환되는 하위 모델에 플러그 앤 플레이 방식으로 배포할 수 있게 합니다. 학습된 어댑터는 CFG(Classifier-Free Guidance), 적은 단계의 샘플링, 자기회귀 생성 시의 오류 수정 능력을 포함하며, 하위 모델의 구조 변화에도 유지됩니다. 54개의 하위 모델과 8개 태스크 카테고리에서 검증한 결과, 타겟별 재학습 없이도 높은 호환성과 성능을 보였습니다.
핵심 결과
-
한 번의 학습으로 다양한 하위 모델에 즉시 적용 가능한 재사용 가능한 LoRA 어댑터 개발
-
CFG 제어, 적은 단계 샘플링, 긴 문맥 오류 수정 등 핵심 능력을 독립적인 어댑터로 분리
-
하위 모델의 조건부 분기나 출력 채널 확장 등 구조적 변화에도 유지되는 강력한 호환성
실무에서 볼 만한 점
특정 태스크용 모델을 만들 때마다 매번 증류 과정을 반복할 필요 없이, 학습된 LoRA를 플러그인처럼 교체하며 효율적으로 배포할 수 있습니다.
읽을 때 확인할 점
-
제시된 LoRA 가중치를 기존 비디오 생성 모델에 적용하여 호환성 테스트
-
CFG LoRA와 Few-step LoRA를 결합하여 제어력과 속도 간의 트레이드오프 확인
-
다양한 하위 태스크(편집, 로보틱스 등)로의 전이 학습 효율성 검증