WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms
데이터 적응형 변환(WUSH)을 통해 2비트 수준의 초저비트 KV 캐시 양자화를 구현하여 긴 문맥 추론 효율을 극대화한 기술입니다.
논문이 다루는 내용
LLM의 문맥 길이가 길어짐에 따라 KV 캐시의 메모리 및 대역폭 비용이 급증하는 문제가 발생합니다. 이를 해결하기 위해 데이터의 2차 통계량을 활용하여 양자화 오차를 최소화하는 WUSH-KV를 제안합니다. WUSH-KV는 별도의 Key/Value 변환을 구성하며, Value 변환은 가중치에 폴딩하고 Key 변환은 RoPE 적용 후에 적용하는 방식을 취합니다. 실험 결과, 제안된 방식은 기존 OSCAR 방식 대비 낮은 perplexity를 기록하며 2비트 양자화에서도 우수한 성능을 보였습니다. 최종적으로 SGLang에 통합되어 실질적인 추론 성능 향상을 입증했습니다.
핵심 결과
-
데이터의 2차 통계량을 활용한 데이터 적응형(Data-adaptive) 변환 기법 도입
-
Key와 Value에 최적화된 별도 변환을 적용하고 가중치 폴딩(Folding)을 통해 효율성 확보
-
2비트 초저비트 양자화 환경에서 기존 방식 대비 낮은 perplexity 및 높은 성능 달성
실무에서 볼 만한 점
메모리 제약이 큰 환경에서 긴 문맥(Long-context) 추론을 수행할 때, KV 캐시 용량을 획기적으로 줄이면서도 모델 성능 저하를 최소화할 수 있습니다.
읽을 때 확인할 점
-
SGLang 환경에서 기존 OSCAR 방식과 WUSH-KV의 perplexity 및 추론 속도 비교 실험
-
다양한 모델 크기 및 문맥 길이(Context Length)에 따른 양자화 효율성 검증
-
2비트 이하 초저비트 설정 시 모델의 Downstream Task 성능 유지 여부 확인