논문
Scaling and Distilling Text Embeddings for Better Diffusibility
확산 언어 모델(DLM)의 생성 성능을 높이기 위해 임베딩 모델의 변별력을 조절하는 증류(Distillation) 기법 제안
논문이 다루는 내용
최근 연속적 확산 언어 모델(DLM)이 주목받고 있으나, 어떤 임베딩이 생성에 가장 적합한지에 대한 연구가 필요했습니다. 기존의 강력한 임베딩 모델은 변별력이 너무 높아 유사한 단어 간 거리가 멀어지며, 이는 샘플링 과정에서 생성 실패를 유발하는 문제가 있었습니다. 이를 해결하기 위해 교사 모델의 확률 분포를 소프트 라벨로 사용하는 학생 모델 증류 방식을 제안합니다. 이 과정을 통해 임베딩 공간을 더 연결성 있고 확산 가능한 형태로 재구성했습니다. 결과적으로 제안된 방식은 기존 GPT-2-M보다 우수한 생성 성능을 달성했습니다.
핵심 결과
-
강력한 임베딩 모델이 오히려 확산 모델의 생성 성능을 저해할 수 있음을 발견
-
소프트 라벨을 활용한 지식 증류로 임베딩 공간의 연결성(Diffusibility) 확보
-
변별력과 생성 가능성 사이의 균형을 맞춘 최적의 잠재 공간 구축
실무에서 볼 만한 점
텍스트 생성 모델의 잠재 공간(Latent Space) 설계 시, 단순히 높은 변별력이 아닌 생성 모델과의 호환성이 중요함을 시사합니다.
읽을 때 확인할 점
-
기존 임베딩 모델을 사용 중인 Diffusion 모델에 소프트 라벨 기반 증류 적용 실험
-
임베딩 공간의 밀도(Density)와 생성 성능 간의 상관관계 분석
-
다양한 규모의 LLM 임베딩을 활용한 확산 모델 성능 벤치마크 수행