Adversarial Training for Pixel Diffusion
사전 학습된 픽셀 확산 모델에 적대적 학습(Adversarial Training)을 결합하여 고주파 디테일과 이미지 품질을 개선하는 방법론
논문이 다루는 내용
픽셀 기반 확산 모델은 오토인코더 없이 직접 이미지를 생성하지만, 미세한 자연 이미지 통계(고주파 성분)를 재현하는 데 한계가 있습니다. 본 논문은 사전 학습된 모델의 구조와 샘플링 과정을 유지하면서, 저노이즈 타임스텝에 적대적 손실(Adversarial Loss)을 추가하는 사후 학습 방식을 제안합니다. 실험 결과, 이 방법은 분포 충실도, 커버리지, 프롬프트 정렬 및 지각적 품질을 동시에 향상시켰습니다. 분석 결과, 적대적 학습은 부족했던 고주파 대역의 스펙트럼 파워를 복원함으로써 성능을 개선하는 것으로 나타났습니다. 반면, 잠재 확산 모델(Latent Diffusion)에서는 이러한 효과가 미미함을 확인하여 직접적인 픽셀 출력 접근성이 핵심임을 입증했습니다.
핵심 결과
-
사전 학습된 픽점 확산 모델에 적대적 손실을 추가하는 효율적인 사후 학습(Post-training) 기법 제안
-
고주파 성분 부족 문제를 해결하여 이미지의 지각적 품질과 분포 충실도를 동시에 개선
-
잠재 확산 모델(LDM)과 달리 픽셀 기반 모델에서만 효과적인 '직접 출력 접근성'의 중요성 규명
실무에서 볼 만한 점
모델 구조를 변경하지 않고도 기존 픽셀 기반 생성 모델의 디테일과 품질을 비약적으로 높일 수 있는 실용적인 최적화 기법입니다.
읽을 때 확인할 점
-
기존 픽셀 기반 확산 모델에 적대적 손실을 결합한 미세 조정(Fine-tuning) 실험 수행
-
Perceptual Loss와 Adversarial Loss 간의 고주파 복원 효과 차이 비교 분석
-
픽셀 기반 모델과 잠재 기반 모델 간의 사후 학습 효과 차이 검증