Tacit-TTS: From Autoregressive Decoding to Masked Prediction for Efficient Transcript-Free Voice Cloning
텍스트 없이 음성만으로 고품질 음성 복제가 가능한 초고속 비자기회적(Non-autoregressive) TTS 시스템
논문이 다루는 내용
기존의 자기회귀(Autoregressive) 방식 TTS는 뛰어난 음성 복제 성능을 보이지만 순차적 디코딩으로 인해 생성 지연 시간이 발생하는 문제가 있었습니다. 또한 기존 비자기회적 방식은 참조 음성의 텍스트 스크립트가 필요하다는 제약이 있었습니다. 본 논문은 IndexTTS2를 증류(Distillation)하여 텍스트 없이도 작동하는 Tacit-TTS를 제안합니다. 모델은 자기회적 디코딩을 마스킹 기반 비자기회적 생성 방식으로 교체하고, 학습이 필요 없는 음향 길이 추정 및 ReFlow 증류를 도입했습니다. 실험 결과, Tacit-TTS는 5초 이상의 음성 생성 시 IndexTTS2보다 10배 이상 빠르면서도 경쟁력 있는 품질을 달성했습니다. 특히 텍스트 의존성을 제거함으로써 다국어 및 비언어적 참조(아기 소리, 가상 언어 등)에서도 안정적인 성능을 입증했습니다.
핵심 결과
-
자기회적 디코딩을 마스킹 기반 비자기회적 생성 방식으로 전환하여 생성 속도 극대화
-
텍스트 스크립트 없이 음성만으로 동작하는 Transcript-free 제로샷 음성 복제 구현
-
ReFlow 증류 및 학습 없는 음향 길이 추정 기법을 통한 효율적인 추론 구조 설계
실무에서 볼 만한 점
텍스트 입력 없이 음성 파일만으로 즉각적인 음성 복제가 가능하며, 실시간 서비스에 적합한 초고속 추론 속도를 제공합니다.
읽을 때 확인할 점
-
제시된 ReFlow 증류 기법을 기존 TTS 모델에 적용하여 추론 속도 변화 측정
-
텍스트가 없는 노이즈 섞인 음성 데이터셋에서의 복제 품질 테스트
-
다국어 환경에서 스크립트 없이 음성 특징만으로 전달되는 정보량 확인