HiRAE: Hierarchical Representation Autoencoding with Residual Budgets
계층적 잔차 보정 방식을 통해 생성 모델과의 호환성을 유지하면서도 이미지 재구성 정밀도를 높인 새로운 오토인코더 프레임워크
논문이 다루는 내용
사전 학습된 시각 표현은 이미지 생성에 유용하지만, 세밀한 디테일을 보존하는 데 한계가 있습니다. 기존의 계층적 특징 융합 방식은 레이어 선택을 위한 수동 튜닝이 필요하거나 학습 복잡도가 높다는 문제가 있었습니다. 본 논문은 전체 인코더 계층을 활용하는 HiRAE(Hier상적 표현 오토인코더)를 제안합니다. 깊은 레이어의 표현을 기준으로 얕은 레이어에서 발생하는 잔차(residual)를 제어하는 그룹별 노름 캡(norm caps) 방식을 도입했습니다. 실험 결과, HiRAE-24는 기존 RAEv2 대비 재구성 FID를 낮추면서도 텍스트-이미지 생성 성능(GenEval 등)을 크게 향상시켰습니다.
핵심 결과
-
계층적 잔차 보정(Residual Corrections)을 통한 세밀한 디테일 복원
-
그룹별 노름 캡(Group-wise norm caps)을 통한 안정적인 계층적 융합 및 생성 모델 호환성 확보
-
기존 모델 대비 재구성 품질 및 텍텍스트-이미지 정렬(Alignment) 성능 향상
실무에서 볼 만한 점
생성 모델의 잠재 공간(Latent Space) 크기를 유지하면서도 더 선명한 이미지를 얻고 싶을 때 적용 가능한 효율적인 아키텍처 설계 방식을 제시합니다.
읽을 때 확인할 점
-
기존 Diffusion 모델의 VAE/Autoencoder를 HiRAE 구조로 교체하여 재구성 품질 변화 관찰
-
다양한 레이어 깊이(depth) 설정에 따른 잔차 보정값의 안정성 테스트
-
텍스트-이미지 생성 태스크에서 HiRAE 기반 잠재 표현의 정렬 성능 벤치마크