논문Hugging Face
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
논문 ID: 2608.0260271 추천
#LLM#Diffusion#Generative Modeling#NLP#Vision#Video#Audio#Evaluation#Inference
핵심 요약
텍스트의 해상도를 유지하면서 확산 모델(Diffusion)을 통해 고성능 언어 생성을 구현한 연속 잠재 공간 기반 언어 모델링 기술
상세 내용
기존의 텍스트 생성은 이산적 토큰에 의존하는 반면, 이미지나 비디오와 같은 연속적 잠재 공간 모델링 방식은 텍스트의 정밀도를 희생하는 경향이 있었습니다. 기존 방식은 생성 모델에 맞추기 위해 표현력을 단순화하거나 압축하는 과정에서 토큰 수준의 충실도가 떨어지는 문제가 있었습니다. 이를 해결하기 위해 AURORA-LM은 텍st 표현 구축과 분포 모델링을 분리하는 구조를 제안합니다. Query-based Encoder-Decoder로 고용량 잠재 표현을 만들고, Block-causal Diffusion Transformer를 통해 Flow matching 방식으로 분포를 학습합니다. 결과적으로 AURORA-LM은 기존 연속/확산 기반 언어 모델들 사이에서 최고 성능을 기록하며, 효율적인 연산량으로도 대규모 모델을 능가하는 성능을 보여주었습니다.
주요 내용
- Query-based Encoder-Decoder를 통한 고용량/디코딩 가능 텍스트 잠재 표현 확보
- Block-causal Diffusion Transformer와 Flow matching을 결합한 효율적 생성 구조
- 노이즈 입력 경로만 제한하고 전체 클린 잠재 타겟을 유지하여 정보 손실 최소화
실무에서 볼 만한 점
이산적 토큰 방식의 한계를 넘어 연속적 잠재 공간에서 텍스트를 생성하는 새로운 패러다임을 제시하며, 향후 멀티모달 모델링의 핵심 기술이 될 수 있습니다.
참고할 행동
- 제시된 Block-causal 구조를 활용한 소규모 텍스트 생성 실험
- Flow matching과 기존 Autoregressive 방식의 생성 품질 비교
- 다양한 압축률(Latent width)에 따른 디코딩 성능 변화 측정