E-MoE: Enhanced Mixture-of-Experts for Non-Factorized Diffusion Language Models
MoE 구조를 활용하여 적은 단계의 디퓨전 생성 과정에서 발생하는 위치 간 상관관계 문제를 해결하고 생성 품질을 높인 연구
논문이 다루는 내용
기존의 Masked Diffusion Models(MDMs)는 역과정에서 위치별로 분리된(factorized) 방식을 사용하여 적은 단계의 생성 시 품질이 저하되는 문제가 있었습니다. 이를 해결하기 위해 연속적인 가우시안 잠재 변수를 사용하는 방식이 제안되었으나, 이는 잠재 변수가 무시되는 후험 붕괴(posterior collapse) 현상에 취약했습니다. 본 논문은 MoE 백본의 전문가 라우팅 결정을 통해 이산적 공유 잠재 변수를 생성하는 E-MoE 방식을 제안합니다. 이 방식은 활성 파라미터 수를 늘리지 않으면서도 위치 간 상관관계를 포착할 수 있는 혼합 분포를 구축합니다. 실험 결과, MNIST 및 LM1B 등 다양한 벤치마크에서 기존 분리형 모델 대비 적은 단계에서의 생성 성능을 크게 개선했습니다.
핵심 결과
-
MoE의 전문가 라우팅을 활용한 이산적 공유 잠재 변수 도입
-
활성 파라미터 증가 없이 위치 간 상관관계를 포착하는 비분리형(Non-factorized) 구조 구현
-
적은 단계(few-step) 생성 시 발생하는 품질 저하 및 후험 붕괴 문제 해결
실무에서 볼 만한 점
적은 연산량(few-step)으로도 고품질의 텍스트/시퀀스 생성이 필요한 실시간 생성 모델 개발에 중요한 아이디어를 제공합니다.
읽을 때 확인할 점
-
기존 Masked Diffusion 모델에 MoE 라우팅 기반의 잠재 변수 주입 실험
-
학습 시 발생하는 후험 붕괴(posterior collapse) 현상 모니터링
-
파라미터 효율성 측면에서 기존 분리형 모델과 성능/속도 비교