VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents
Append-only 방식의 메모리 한계를 극복하기 위해 '쓰기(Rewrite)' 연산이 포함된 이중 루프 구조로 장편 비디오 추론 성능을 높인 에이전트 프레임워크
논문이 다루는 내용
장편 비디오 이해를 위해 멀티모달 에이전트는 반복적인 추론 과정을 거치며 증거를 수집해야 합니다. 기존의 단순 추가형(Append-only) 메모리 방식은 컨텍스트가 길어질수록 노이즈가 쌓이고 핵심 정보에 대한 주의력이 분산되는 '시맨틱 스래싱(Semantic Thrashing)' 문제를 야기합니다. 이를 해결하기 위해 본 논문은 외부 파일 시스템과 결합된 이중 루프 구조인 VideoLoop를 제안합니다. 외곽 루프는 비디오 추론을 담당하고, 내부 루프은 과거 관찰값과 중간 분석 결과로부터 아티팩트를 추출하여 제한된 작업 메모리를 재작성(Rewrite)합니다. 실험 결과, VideoLoop는 기존 LVLM 백본에 플러그앤플레이 방식으로 적용 가능하며 VideoMME(long) 등 주요 벤치마크에서 성능 향상을 입증했습니다.
핵심 결과
-
Append-only 메모리 방식이 노이즈 축적 및 정보 손실을 유발하는 구조적 원인 규명
-
이중 루프(Outer-Inner Loop) 구조를 통한 무제한 저장소와 제한된 작업 메모리의 분리
-
과거 관찰 데이터에서 핵심 정보를 추출하여 메모리를 갱신하는 'Rewrite' 메커니즘 도입
실무에서 볼 만한 점
컨텍스트 길이가 길어질수록 성능이 급락하는 LLM/VLM 기반 에이전트 설계 시, 메모리 관리 전략(Rewrite vs Append)의 중요성을 시사합니다.
읽을 때 확인할 점
-
기존 RAG 기반 에이전트에 '메모리 요약/재작성' 단계를 추가하여 성능 변화 관찰
-
컨텍스트 길이에 따른 정보 유지율(Retention) 변화를 측정하는 실험 설계
-
무제한 저장소(Filesystem)와 작업 메모리(Working Memory) 간의 데이터 동기화 로직 구현