CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding
모델 파라미터 업데이트 없이 정책과 도구를 동시에 진화시켜 초장기 비디오 탐색 효율을 극대화하는 프레임워크
논문이 다루는 내용
초장기 비디오 템포럴 그라운딩은 제한된 시각적 예산 내에서 광범위한 증거 탐색과 세밀한 이벤트 이해 사이의 균형을 맞추는 것이 필수적입니다. 기존 에이전트 방식은 사전 정의된 정책과 도구 능력에 의존하여 유연성이 부족하다는 문제가 있었습니다. 이를 해결하기 위해 본 논문은 VLM의 추론 궤적을 바탕으로 고수준 정책과 실행 가능한 미디어 도구를 공동 진화시키는 CoEvoWhen 프레임워크를 제안합니다. 외부 스킬 업데이터가 작업 경험을 증류하여 정책을 정교화하는 동시에, 코딩 능력을 활용해 도구를 업그레이드하거나 신규 생성하여 증거 확보 능력을 최적화합니다. 실험 결과, 제안 방식은 정확도를 높이면서도 추론 시 시각적 토큰 비용을 절감했으며, 일반적인 장기 비디오 QA에서도 높은 범용성을 입증했습니다.
핵심 결과
-
정책(Policy)과 도구(Tool)를 동시에 진화시키는 Coevolution 프레임워크 제안
-
모델 파라미터 업데이트 없이 외부 스킬 업데이터를 통한 재사용 가능한 스킬 형성
-
이미지 기반 광역 탐색과 비디오 기반 세밀 탐색의 효율적 오케스트레이션
실무에서 볼 만한 점
모델 자체를 재학습시키지 않고도 에이전트의 행동 양식과 도구 활용 능력을 최적화하여 효율적인 비디오 분석 시스템을 구축할 수 있습니다.
읽을 때 확인할 점
-
VLM의 코딩 능력을 활용한 자동 도구 생성 로직 구현 테스트
-
정책 업데이트 시 발생하는 스킬 간 충돌(Conflict) 현상 분석
-
다양한 비디오 해상도 및 프레임 레이트 환경에서의 도구 적응성 검증