EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation
추가 학습 없이 감정 벡터를 분해하여 감정 표현의 정확도와 자연스러움을 동시에 높이는 TTS 제어 기법
논문이 다루는 내용
기존의 감정 조건부 TTS 모델은 요청된 감정을 안정적으로 표현하지 못하는 경우가 많으며, 이를 개선하기 위한 추가 학습은 비용이 많이 듭는 문제가 있습니다. 기존의 벡터 스티어링 방식은 감정 벡터를 하나의 방향으로만 취급하여 감정 표현의 정밀도가 떨어지는 한계가 있었습니다. 본 논문에서는 감정 벡터가 중립에서 벗어나게 하는 '공유 성분'과 특정 감정으로 유도하는 '잔차 성분'으로 분해될 수 있음을 발견했습니다. 이를 바탕으로 백본 모델의 재학습 없이 두 성분을 개별적으로 제어하는 EmoRES 방식을 제안합니다. 실험 결과, 기존 CoCoEmo 대비 감정 식별 정확도와 자연스러움 측면에서 유의미한 성능 향상을 달้ม았습니다.
핵심 결과
-
감정 벡터를 '공유 성분(Shared)'과 '잔차 성분(Residual)'으로 분해하는 메커니즘 발견
-
백본 모델을 동결(Frozen)한 상태에서 작동하는 학습 불필요(Training-free) 방식
-
감정 표현의 강도와 정밀도를 독립적으로 조절하여 감정 일치도와 음성 품질 개선
실무에서 볼 만한 점
모델 재학습 없이 기존에 학습된 TTS 모델의 감정 표현력을 즉각적으로 개선할 수 있어 운영 비용과 데이터 확보 문제를 동시에 해결할 수 있습니다.
읽을 때 확인할 점
-
IndexTTS-2 또는 CosyVoice2 백본 모델에 제안된 분해 로직 적용 테스트
-
감정 벡터의 공유 성분과 잔차 성분 비율 변화에 따른 음성 품질 변화 관찰
-
다양한 감정 태그(Happy, Sad 등)에 대한 벡터 분해 안정성 검증