VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
저정밀도(Low-bit) 환경에서 아웃라이어 문제를 해결하고 Softmax 연산 병목을 제거하여 비디오 생성 모델의 추론 속도를 극대화한 기술
논문이 다루는 내용
Diffusion Transformer 기반 비디오 생성 모델은 긴 시공간 시퀀스로 인해 어텐션 연산 비용이 매우 높습니다. 기존의 저정밀도 양자화는 아웃라이어 값으로 인해 정확도가 저하되고, Softmax의 고정밀 지수 연산이 하드웨어 가속의 병목이 되는 문제가 있었습니다. 이를 해결하기 위해 제안된 VC-Attention은 클러스터링 기반의 Value Smoothing(V-Smooth)과 Softmax 연산을 직접 매핑하는 ExpCast-FP8 기법을 결합합니다. V-Smooth는 값들을 재정렬하여 양자화 효율을 높이고, ExpCast-FP8은 FP32 지수 연산 없이 확률 코드로 직접 변환하여 속도를 높입니다. 실험 결과, 최신 GPU 환경에서 기존 BF16 대비 최대 3.6배의 속도 향상과 향상된 생성 품질을 달성했습니다.
핵심 결과
-
V-Smooth: 온라인 클러스터링을 통해 Value 토큰을 재정렬하여 저정밀도 양자화 오차 최소화
-
ExpCast-FP8: 로그 도메인 점수를 FP8 확률 코드로 직접 매핑하여 Softmax 연산 병목 제거
-
Training-free: 추가 학습 없이 기존 모델에 즉시 적용 가능한 저정밀도 프레임워크
실무에서 볼 만한 점
비디오 생성 모델과 같은 거대 모델의 추론 비용을 낮추면서도 성능 저하 없이 하드웨어 가속을 극대화할 수 있는 실전적인 최적화 기법입니다.
읽을 때 확인할 점
-
HunyuanVideo나 Wan2.2 같은 최신 비디오 모델에 VC-Attention 로직 적용 테스트
-
NVIDIA Blackwell/Hopper 아키텍처 환경에서 FP8 커널 성능 벤치마크 수행
-
기존 양자화 방식(SmoothQuant 등)과 VC-Attention의 생성 품질 비교 실험