Circuit Hypernetworks for Quantum-Augmented Diffusion Language Models
고정된 거대 언어 모델(LLM)에 토큰별로 최적화된 양자 회로를 결합하여 효율적으로 성능을 향상시키는 하이퍼네트워크 프레임워크 제안
논문이 다루는 내용
기존 언어 모델의 연산을 토큰 단위로 적응시키는 방식 중 하나로 양자 회로를 활용할 수 있으나, 거대 모델 내에서 넓은 회로를 평가하는 것은 계산 비용이 매우 높습니다. 본 논문에서는 고정된 마스크 확산 언어 모델에 토큰 조건부 양자 잔차 분기(Quantum Residual Branch)를 추가하는 HyperQ를 소개합니다. HyperQ는 가벼운 회로 하이퍼네트워크를 통해 토큰별 회로 좌표, 회전 각도, 결합 강도 등을 생성하며, 백본은 동결한 채 추가된 분기만 학습합니다. 제안된 방식은 기대값 계산 비용이 큐비트 수에 선형적으로 비례하여 16~64 큐비트 규모의 회로를 1.1B 파라미터 백본에서 효율적으로 학습할 수 있습니다. 실험 결과, 회로 너비가 증가함에 따라 성능이 향상되었으며 64 큐비트 환경에서 기존 백본 및 LoRA 방식보다 우수한 성능을 기록했습니다.
핵심 결과
-
고정된 백본 모델을 유지하며 토큰별로 최적화된 양자 회로를 삽입하는 하이퍼네트워크 구조 제안
-
큐비트 수에 비례하는 선형적 계산 비용을 통해 16~64 큐비트 규모의 대규모 양자 회로 학습 가능
-
적은 양의 데이터(20,000개)로도 기존 클래식 베이스라인보다 높은 성능 달성
실무에서 볼 만한 점
거대 모델 전체를 재학습하지 않고도 양자 컴퓨팅의 이점을 결합할 수 있는 효율적인 파라미터 효율적 미세조정(PEFT) 전략을 제시합니다.
읽을 때 확인할 점
-
제시된 하이퍼네트워크 구조를 소규모 언어 모델(SLM)에 적용하여 확장성 테스트
-
다양한 백본 모델(Llama 등)에서의 양자 잔차 분기 호환성 검증
-
큐비트 수 증가에 따른 계산 복잡도와 성능 향상 간의 임계점 분석