Hierarchical Continuous Diffusion Language Models
이산적 토큰 생성과 연속적 잠재 상태를 결합하여, 생성 시 토큰 간 의존성 문제를 해결한 계층적 연속 확산 언어 모델 제안
논문이 다루는 내용
기존의 이산적 확산 언어 모델은 병렬 디코딩 시 토큰 간 통계적 의존성이 끊어지는 구조적 병목 현상을 가집니다. 반면 연속적 확산 모델은 토큰 구성과의 연결성이 부족하여 유효한 텍스트 생성이 어렵다는 문제가 있습니다. 이를 해결하기 위해 본 논문은 이산적 토큰 생성과 연속적 잠재 궤적을 단일 노이징 과정에 결합한 HC-DLM을 제안합니다. 제안된 모델은 잠재 상태를 유일한 생성 상태로 유지하며, 토큰을 잠재 상태에서 읽어내고 이를 다시 다음 업데이트의 스캐폴드로 피드백하는 방식을 취합니다. 실험 결과, Sudoku, Countdown, LM1B 데이터셋에서 기존 이산/연속 확산 베이스라인 대비 성능 향상을 입증했습니다.
핵심 결과
-
이산적 토큰 생성과 연속적 잠재 궤적을 결합한 계층적 구조 설계
-
토큰 생성과 잠재 상태 업데이트 간의 상호 피드백 메커니즘 도입
-
변분 하한(Variational Bound) 기반의 원리적 학습 목적 함수 정의
실무에서 볼 만한 점
제약 조건 준수가 중요한 퍼즐 해결이나 복잡한 계획 수립 작업에서 기존 자기회귀(AR) 모델의 한계를 극복할 수 있는 새로운 생성 패러다임을 제시합니다.
읽을 때 확인할 점
-
제안된 변분 하한(Variational Bound) 수식이 기존 확산 모델과 어떻게 다른지 수학적 검증
-
Sudoku와 같은 구조적 추론 태스크에서 기존 LLM과 성능 비교 실험
-
잠재 상태 크기에 따른 생성 품질 및 연산 비용의 트레이드오프 분석