아티클 목록으로
음성·오디오

SwanTale: 다중 화자 음성과 오디오 장면을 통합 생성하는 모델

약 3분 소요

들어가며

음성 생성 기술은 더 이상 텍스트를 자연스럽게 읽어 주는 기능에만 머물지 않는다. 애니메이션 더빙, 오디오 드라마, 영화, 광고, 게임, 팟캐스트, 숏폼 영상 제작에서는 여러 캐릭터의 목소리, 말투, 감정, 배경 환경, 효과음을 함께 설계해야 한다. Hugging Face Daily Papers에 소개된 SwanTale은 이런 제작 환경을 겨냥해 다중 화자 음성과 오디오 생성을 하나의 모델로 통합하려는 연구다.

핵심 내용

  • 두 가지 생성 방식을 통합: SwanTale은 instruct 작업과 zero-shot 작업을 모두 지원한다. instruct 방식은 환경, 화자 스타일, 세부 콘텐츠를 설명하는 caption을 입력으로 사용한다. zero-shot 방식은 참조 오디오와 동일한 수준의 세부 콘텐츠 정보를 함께 활용한다.
  • 데이터 측면의 기반 강화: 연구진은 SwanData-Caption을 제안했다. 이는 원시 음성 및 오디오 데이터를 정제하고, 필요한 합성 데이터를 보강하며, 다양한 수준의 정확한 caption을 붙이는 절차다. 복잡한 오디오 장면을 만들려면 단순한 대사 텍스트뿐 아니라 화자의 특징, 장면 정보, 음향 요소가 데이터에 잘 표현되어야 한다.
  • 다중 오디오 모달리티 생성: SwanTale은 SwanVAE를 도입해 고품질의 다중 오디오 모달리티 생성을 지원한다. 이는 음성 복제나 표현형 TTS에만 초점을 맞추는 것이 아니라, 음성·환경음·효과음이 함께 존재하는 결과물을 목표로 한다는 뜻이다.
  • 통합 모델링과 후학습: 모델은 보상 조건 품질 제어, Engram conditioning, Unified MoE를 활용해 여러 작업과 오디오 모달리티를 함께 학습한다. 또한 커리큘럼 학습과 GRPO 후학습을 통해 복잡한 지시를 단계적으로 학습하고 강화하도록 설계됐다.

의미와 영향

SwanTale의 의미는 음성 생성의 중심을 “한 사람이 문장을 읽는 것”에서 “여러 인물이 등장하는 소리 장면을 만드는 것”으로 확장했다는 데 있다. 제작자는 자연어로 캐릭터의 목소리와 말투, 장면의 분위기, 오디오 효과를 지정할 수 있고, 이후 설계한 목소리를 재사용하는 흐름도 기대할 수 있다. 참조 음성이 있는 경우에는 제로샷 방식으로 해당 음성의 특성을 활용할 수 있다.

논문은 SwanTale이 여러 주요 제로샷 및 지시 기반 평가 지표에서 앞섰고, 두 작업 모두에서 높은 표현력 점수를 얻었다고 설명한다. 다만 실제 제품화 단계에서는 긴 오디오에서의 일관성, 품질 안정성, 제어 가능성, 음성 정체성과 권리 관리 같은 문제가 중요하게 남는다. 그럼에도 SwanTale은 생성형 오디오가 단순 TTS를 넘어, 다중 캐릭터와 음향 장면을 제어하는 창작 도구로 진화하고 있음을 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Fender CEO의 “밴드 동료는 아날로그 AI” 비유가 불러온 논란
음성·오디오
cctest.ai
음성·오디오

Fender CEO의 “밴드 동료는 아날로그 AI” 비유가 불러온 논란

Fender CEO Edward “Bud” Cole이 커버곡 학습과 밴드 협업을 ‘아날로그 AI’에 비유한 발언이 다시 확산되며 음악인들의 반발을 사고 있다. 논란은 AI 음악, 저작권, 인간 창작의 가치가 충돌하는 지점을 보여준다.

더 보기
CCTest · Blog
빌보드에 오른 랩 싱글 ‘Rubberz’, 왜 AI 음악 의혹을 받나
음성·오디오
cctest.ai
음성·오디오

빌보드에 오른 랩 싱글 ‘Rubberz’, 왜 AI 음악 의혹을 받나

Fenix Flexin의 ‘Rubberz’가 Billboard Hot 100에 진입한 뒤 생성형 AI로 만든 곡이 아니냐는 의혹이 커지고 있다. 논란은 갑작스러운 장르 변화뿐 아니라 음원 아티팩트, 가사, 이미지 자료, 라이브 재현성까지 이어진다.

더 보기