DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence
고압축 토크나이저 환경에서도 디퓨전 모델의 수렴 속도와 재구성 정밀도를 동시에 확보하는 분리형 시맨틱 오토인코더(DC-SAE) 제안
논문이 다루는 내용
확산 모델(Diffusion Model)의 효율적인 확장을 위해 고압축 토크나이저가 필수적이지만, 압축률이 높아질수록 재구성 품질이 떨어지고 디퓨전 학습 난이도가 상승하는 트레이드오프가 발생합니다. 기존의 시맨틱 인코더 기반 방식은 학습 속도는 빠르나 압축률에 한계가 있고 세부 디테일 손실이 발생하는 문제가 있었습니다. 이를 해결하기 위해 본 논문은 거시적 의미를 담는 시맨틱 인코더와 미세 디테일을 보존하는 픽셀 레벨 인코더를 결합한 DC-SAE를 제안합니다. 실험 결과, DC-SAE는 높은 압축률에서도 기존 SOTA 모델인 DC-AE 대비 PSNR과 gFID 측면에서 압도적인 성능을 보였습니다. 또한, 높은 압축 환경에서도 디퓨전 모델의 빠른 수렴과 고해상도 이미지 생성 능력을 입증했습니다.
핵심 결과
-
거시적 의미(Semantic)와 미세 디테일(Pixel-level)을 분리하여 처리하는 이중 인코더 구조 설계
-
고압축 환경에서도 디퓨전 모델의 학습 수렴 속도를 가속화하는 효율적인 잠재 공간 형성
-
고해상도(1024x1024) 텍스트-이미지 생성 작업에서 우수한 성능 및 효율성 입증
실무에서 볼 만한 점
압축률을 높이면서도 생성 모델의 학습 시간을 단축하고 고화질 이미지를 얻고 싶은 엔지니어에게 실질적인 아키텍처 가이드를 제공합니다.
읽을 때 확인할 점
-
기존 VAE/VQ-VAE 기반 디퓨전 파이프라인에 DC-SAE 구조를 교체 적용하여 학습 수렴 속도 비교
-
다양한 압축 배율(Compression Ratio) 변화에 따른 재구성 품질 및 생성 품질의 트레이드오프 분석
-
고해상도 생성 시 연산 비용(Throughput) 대비 성능 효율성 검증