ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
MLLM의 추론 능력을 활용하여 복잡하고 암시적인 지시사항까지 수행하는 고성능 비디오 편집 프레임워크 제안
논문이 다루는 내용
기존의 지시 기반 비디오 편집 방식은 MLLM을 단순한 의미 인코더로만 사용하여 인과 관계나 암시적 의도가 포함된 복잡한 편집 작업에 한계가 있었습니다. 이를 해결하기 위해 본 논문은 MLLM의 사고 과정을 시각적 생성 전 단계에 명시적으로 활성화하는 ThinkV2V 프레임워크를 제안합니다. MLLM-to-DiT 구조를 통해 사고 과정을 정교한 편집 조건 신호로 변환하며, 점진적 커리큘럼 학습과 추론 시간 스케일링 기법을 도입했습니다. 또한 학습 및 평가를 위한 ThinkV2V-150K 데이터셋과 ThinkV2V-Bench를 구축했습니다. 실험 결과, 5B 규모의 모델이 더 큰 10B 규모의 베이스라인을 능가하며 복잡한 편집 시나리오에서 SOTA 성능을 달명했습니다.
핵심 결과
-
MLLM의 사고 과정을 시각적 생성의 조건 신호로 변환하는 MLLM-to-DiT 아키텍처 설계
-
점진적 커리큘럼 학습(Progressive Curriculum Training)과 추론 시간 스케일링(Inference-Time Thinking Scaling) 도입
-
암시적 의도 및 인과 추론 평가를 위한 ThinkV2V-150K 데이터셋 및 벤치마크 구축
실무에서 볼 만한 점
단순한 키워드 매칭을 넘어 사용자의 복잡한 의도를 이해해야 하는 차세대 비디오 생성/편집 에이전트 개발에 중요한 방법론을 제시합니다.
읽을 때 확인할 점
-
제시된 MLLM-to-DiT 구조를 기존 비디오 생성 모델에 이식하여 성능 변화 확인
-
Inference-Time Thinking Scaling 기법을 적용하여 추론 비용 대비 품질 향상 폭 측정
-
ThinkV2V-Bench를 활용하여 현재 보유한 모델의 추론 기반 편집 능력 벤치마킹