PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

논문 ID: 2608.02023114 추천
#Audio-Generation#Multi-Speaker#Zero-Shot#LLM-Post-Training#RAG#Video#Audio
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

핵심 요약

텍스트 지시(Instruct)와 참조 오디오(Zero-shot)를 모두 지원하는 통합 멀티 스피커 음성 및 오디오 생성 모델

상세 내용

애니메이션 더빙이나 게임 제작 등에서 자연스러운 음성 및 환경음 생성이 필요하지만, 기존 방식은 스타일 제어나 참조 오디오 활용을 동시에 수행하기 어려웠습니다. 본 논문은 지시형(Instruct)과 제로샷(Zero-shot) 태스크를 모두 해결하기 위한 데이터 및 모델 프레임워크를 제안합니다. 먼저 정제된 데이터와 정교한 캡션을 제공하는 SwanData-Caption을 구축했습니다. 모델 측면에서는 고품질 생성을 위한 SwanVAE, 보상 기반 품질 제어, Engram 컨디셔닝, 그리고 멀티태스크를 위한 Unified MoE를 도입했습니다. 또한 커리큘럼 학습과 GRPO 사후 학습을 통해 모델의 표현력을 점진적으로 강화했습니다. 실험 결과, SwanTale은 제로샷 및 지시형 태스크 모두에서 최고 수준의 표현력과 복합 생성 능력을 입증했습니다.

주요 내용

  • 지시형(텍스트 기반 스타일/환경 제어)과 제로샷(참조 오디오 기반) 태스크를 통합 지원
  • 고품질 멀티 모달리티 생성을 위한 SwanVAE 및 Unified MoE 구조 도입
  • 데이터 정제(SwanData-Caption)와 GRPO 기반 사후 학습을 통한 표현력 극대화

실무에서 볼 만한 점

콘텐츠 제작 파이프라인에서 텍스트만으로 캐릭터 목소리와 배경음을 동시에 생성하거나, 특정 목소리를 복제하면서 스타일을 제어하는 데 유용합니다.

참고할 행동

  • 제공된 데모를 통해 텍스트 지시와 참조 오디오 간의 일관성 확인
  • 복합적인 환경음(Background)과 음성(Speech)이 섞인 시나리오에서의 품질 테스트
  • GRPO 학습 방식이 모델의 표현력에 미치는 영향 분석