Motion-Omni, 대화 음성과 전신 동작을 한 번에 생성한다
들어가며
대화형 아바타가 자연스럽게 보이려면 말을 할 수 있는 것만으로는 부족합니다. 발화의 의미와 리듬에 맞춰 표정, 손짓, 자세, 하체 움직임도 함께 변해야 합니다. 기존 시스템은 보통 먼저 대화 모델로 음성을 생성한 뒤, 완성된 오디오를 협동 동작 모델에 넣어 아바타를 움직입니다. 구현은 단순하지만 동작 생성을 위해 전체 추론을 다시 수행해야 하고, 말과 움직임을 하나의 목표로 공동 최적화하기 어렵습니다.
베이징대학교 연구진이 제안한 Motion-Omni는 이 분리된 파이프라인을 바꾸려는 시도입니다. 언어 모델, 음성 생성기, 동작 생성기를 연결해 음성을 만들어 내는 은닉 상태에서 발화와 동작을 동시에 생성합니다. 출력 범위에는 명시적인 얼굴 표정과 손, 상체, 하체 움직임이 포함됩니다.
핵심 내용
- 순차 처리에서 공동 생성으로: 동작을 완성된 음성의 후처리로만 만들지 않고, 발화 생성에도 사용되는 내부 표현에서 생성합니다. 의미, 억양, 시간적 리듬을 공유할 수 있는 구조입니다.
- 공동 학습이 중요: 음성 경로를 고정한 채 동작만 학습하면 오디오와 움직임 사이의 불일치가 남았습니다. LLM, Speech Generator, Motion Generator를 음성과 동작 목표에 맞춰 함께 조정해야 정렬과 대화 능력을 동시에 유지할 수 있었습니다.
- 의사 라벨링으로 데이터 확장: 교체 가능한 동작 교사 모델을 사용해 일관된 음색의 음성 응답에 동작 라벨을 붙였습니다. 이를 통해 품질 순위가 매겨진 422,856쌍, 총 1,402시간의 학습 자료를 만들었습니다.
- 통합 평가 프로토콜: SwDA-500을 공개하고, 확률적이며 개방형인 전신 음성 대화를 평가하는 절차를 제시했습니다. 공통 렌더링, 자동 지표, 사람 평가, 지연 측정을 결합하고, 동작 시스템마다 동일한 오디오를 사용해 비교합니다.
- 실시간 처리: Qwen2.5-7B-Instruct 기반 Motion-Omni-Q7은 참조 동작이 없는 지표에서 교사 캐스케이드와의 차이를 2% 이내로 유지했습니다. 실시간 계수는 0.78로 실시간 재생보다 빠르며, 단어 오류율은 2.62%입니다.
의미와 영향
Motion-Omni의 핵심은 단순히 출력 종류를 늘린 데 있지 않습니다. 음성과 신체 표현을 서로 독립적인 후처리 단계로 두지 않고, 공통 내부 표현을 통해 함께 조정할 수 있음을 보여준 점이 중요합니다. 이 방식은 추론 부담을 줄이는 동시에 언어, 운율, 감정, 제스처 사이의 관계를 더 직접적으로 학습할 가능성을 제시합니다.
다만 결과는 사용한 데이터, 동작 교사 모델, 평가 조건의 영향을 받습니다. 의사 라벨의 품질, 동작 스타일의 범위, 다른 언어와 캐릭터 및 상호작용 환경에서의 안정성은 추가 검증이 필요합니다. SwDA-500과 통합 평가 절차는 이런 차이를 비교할 수 있게 하는 기반으로도 의미가 있습니다.
앞으로 실시간 아바타, 게임 캐릭터, 디지털 상담원, 체화형 인터페이스는 음성과 동작을 별도 모듈에서 순차 생성하기보다 하나의 멀티모달 결정으로 함께 생성하는 방향으로 발전할 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…