논문
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
스트리밍 비디오 LLM은 미래 작업의 관련성이 결정되기 전에도 증거를 보존해야 하며, 충분한 정보가 모였을 때 적시에 응답해야 하는 과제를 안고 있습니다. 기존 방식은 실시간 인지 성능을 유지하면서 재사용 가능한 사실적 메모리를 형성하는 데 어려움이 있었습니다. 본 논문은 쿼리 독립적인 증거 기록과 작업 응답을 하나의 공유된 능동적 생성 프로세스로 통합한 OneStreamer를 제안합니다. PHCM(Proactive Hierarchical Caption Memory)을 통해 시간 기반의 상세 캡션과 요약을 생성하여 과거 비디오 특징을 다시 읽지 않고도 재사용 가능한 문맥을 제공합니다. 또한 PSTL(Proactive State Transition Learning)을 도입하여 대기 상태의 지배력을 줄이고 상태 변화를 효과적으로 학습합니다. 실험 결과, OneStreamer-1M 데이터셋으로 학습된 4B 모델은 8개 벤치마크에서 최고 성능을 달성하며 실시간 인지와 메모리 유지 사이의 균형을 입증했습니다.