WorldAttention: An Efficient Attention Architecture for Interactive Video World Models
장기적 문맥 유지와 연산 효율성을 동시에 잡은 계층적 KV 캐시 및 하이브리드 희소 어텐션 기반의 비디오 월드 모델 아키텍처
논문이 다루는 내용
텍스트 지시를 따르는 대화형 비디오 월드 모델은 긴 시간 동안 일관된 환경을 시뮬레이션하는 것이 중요합니다. 기존의 슬라이딩 윈도우 방식은 연산량은 줄이지만 과거 문맥을 소실하고, 전체 캐시 유지 방식은 메모리 포화 문제를 야기합니다. 이를 해결하기 위해 본 논문은 하이브리드 희소 어텐션(HSA)과 계층적 KV 캐시(HKV)를 결합한 WorldAttention을 제안합니다. HSA는 선형 글로벌 어텐션과 헤드 적응형 희소 어텐션을 결합하여 효율성을 높였으며, HKV는 과거 데이터를 의미론적 페이지로 관리하여 메모리 효율을 극대화합니다. 실험 결과, 제안된 방식은 기존 SOTA 모델들을 상회하며 높은 주체 일관성을 입증했습니다.
핵심 결과
-
Hybrid Sparse Attention (HSA): 선형 글로벌 어텐션과 헤드별 적응형 희소 어텐션의 결합
-
Hierarchical KV Cache (HKV): 의미론적 인덱싱 기반의 다계층 메모리 관리 시스템
-
커스텀 커널 설계: 이론적 효율성을 실제 GPU 성능으로 전환하기 위한 최적화된 커널 구현
실무에서 볼 만한 점
에이전트 학습을 위한 장기 비디오 생성 시, 메모리 부족 문제 없이 과거 문맥을 유지하며 고해상도/장기 시뮬레이션을 구현할 수 있는 실질적인 아키텍처를 제시합니다.
읽을 때 확인할 점
-
HSA의 헤드별 희소성(Sparsity) 패턴이 특정 도메인에서 어떻게 변하는지 분석
-
HKV의 페이지 인덱싱 방식이 비디오의 의미적 변화와 어떻게 매칭되는지 검증
-
기존 슬라이딩 윈도우 방식 대비 메모리 점유율 및 추론 속도 벤치마크 수행