OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
실시간 스트리밍 비디오에서 과거 정보를 효율적으로 기억하고 적시에 응답하는 통합형 멀티모달 모델 프레임워크 제안
논문이 다루는 내용
스트리밍 비디오 LLM은 미래 작업의 관련성이 결정되기 전에도 증거를 보존해야 하며, 충분한 정보가 모였을 때 적시에 응답해야 하는 과제를 안고 있습니다. 기존 방식은 실시간 인지 성능을 유지하면서 재사용 가능한 사실적 메모리를 형성하는 데 어려움이 있었습니다. 본 논문은 쿼리 독립적인 증거 기록과 작업 응답을 하나의 공유된 능동적 생성 프로세스로 통합한 OneStreamer를 제안합니다. PHCM(Proactive Hierarchical Caption Memory)을 통해 시간 기반의 상세 캡션과 요약을 생성하여 과거 비디오 특징을 다시 읽지 않고도 재사용 가능한 문맥을 제공합니다. 또한 PSTL(Proactive State Transition Learning)을 도입하여 대기 상태의 지배력을 줄이고 상태 변화를 효과적으로 학습합니다. 실험 결과, OneStreamer-1M 데이터셋으로 학습된 4B 모델은 8개 벤치마크에서 최고 성능을 달성하며 실시간 인지와 메모리 유지 사이의 균형을 입증했습니다.
핵심 결과
-
PHCM(Proactive Hierarchical Caption Memory): 과거 비디오 피처를 재탐색하지 않고 텍스트 기반의 요약/상세 캡션을 통해 재사용 가능한 메모리 구축
-
PSTL(Proactive State Transition Learning): 상태 변화와 유지 토큰을 선택적으로 학습하여 불필요한 대기 상태 학습 문제를 해결
-
OneStreamer-1M: 스트리밍 비디오 상호작용을 위해 구축된 100만 개 이상의 레코드를 포함한 대규모 데이터셋
실무에서 볼 만한 점
실시간 CCTV나 라이브 스트리밍 환경에서 과거 이력을 효율적으로 관리하면서도 지연 시간을 최소화하는 에이전트 개발에 직접적인 영감을 제공합니다.
읽을 때 확인할 점
-
PHCM 방식의 텍스트 메모리가 비디오 피처 재사용 대비 얼마나 많은 정보 손실을 유발하는지 비교 실험
-
PSTL의 상태 변화 토큰 선택 전략을 다른 시계열 데이터 작업에 적용해보기
-
제안된 데이터 합성 파이프라인을 활용하여 특정 도메인(예: 보안, 스포츠) 특화 데이터셋 구축 시도