샤오미, 목표 화자에 집중하는 음성 인식 모델 CocktailASR-1 공개
자동 음성 인식은 주변이 조용하고 한 사람의 목소리가 선명할 때 비교적 안정적으로 작동합니다. 그러나 회의나 모임처럼 여러 사람이 동시에 말하는 환경에서는 문제가 달라집니다. 시스템은 소리를 문자로 바꾸는 데 그치지 않고, 섞여 있는 음성 가운데 누가 말했는지 구분한 뒤 어느 사람의 발화를 인식할지 선택해야 합니다. 음성 처리 분야에서 오랫동안 논의된 ‘칵테일 파티 문제’가 바로 이 상황을 가리킵니다.
샤오미가 공개한 CocktailASR-1은 목표 화자 음성 인식을 중심으로 이 문제에 접근합니다. 공개된 설명에 따르면 핵심은 단순히 더 강력한 소음 제거를 적용하는 것이 아닙니다. 먼저 사용자가 듣고 싶은 화자에 대한 정보를 제공하고, 이후 혼합된 음성에서 해당 화자의 발화를 추적해 인식하며 다른 사람의 말은 가능한 한 출력하지 않는 방식입니다.
핵심 내용
- 겹쳐 말하는 상황을 겨냥: 한 명이 말하는 일반적인 받아쓰기보다 여러 사람이 동시에 발화하는 환경에 초점을 둡니다.
- 화자 지정 정보를 활용: 누구의 목소리를 따라갈지 정하는 정보를 음성 인식 과정의 조건으로 사용합니다.
- 일반적인 소음 제거와 구별: 소음 제거가 불필요한 소리를 억제한다면, 목표 화자 인식은 그중 누구의 목소리를 남겨야 하는지를 먼저 결정합니다.
- 실제 적용을 염두에 둔 공개: 샤오미는 이 모델을 산업용 목표 화자 음성 인식 모델로 소개하고 오픈소스로 공개했습니다.
이 방식의 의미는 모든 소리를 한꺼번에 분리하려는 문제를 조건부 인식 문제로 바꾼다는 데 있습니다. 실제 사용자는 방 안의 모든 사람에 대한 대화록을 원하는 것이 아닐 수 있습니다. 회의에서 특정 참가자의 발언만 따라가거나, 그룹 통화에서 한 사람의 말만 확인하거나, 주변 소음 속에서 특정 사용자의 명령을 인식하려는 경우에는 목표를 좁히는 것이 더 유용할 수 있습니다.
다만 이 접근만으로 칵테일 파티 문제가 해결됐다고 보기는 어렵습니다. 목표 화자 정보를 어떻게 제공하는지, 화자가 잠시 말을 멈춘 뒤에도 동일한 인물을 계속 추적할 수 있는지, 목소리가 비슷한 사람이나 잦은 끼어들기에 어떻게 대응하는지는 여전히 중요한 과제입니다. 현재 확인 가능한 자료에는 CocktailASR-1의 구체적인 구조, 학습 데이터, 평가 결과, 오픈소스 라이선스가 제시되어 있지 않습니다. 따라서 지금 단계에서 종합적인 성능이나 적용 범위를 단정하기보다는 하나의 유의미한 기술 방향으로 보는 편이 타당합니다.
이번 공개가 보여주는 더 큰 흐름은 음성 인식이 ‘들리는 모든 것을 받아쓰는 기술’에서 ‘사용자가 실제로 듣고 싶은 음성을 이해하는 기술’로 확장되고 있다는 점입니다. 회의 기록, 청각 보조, 차량용 대화, 이어폰, 공공장소의 음성 인터페이스 등에서 활용 가능성을 생각해볼 수 있습니다. 실제 영향력은 독립적인 평가와 재현성 검증, 다양한 음향 환경에서의 테스트에 달려 있습니다.
출처: OSChina
댓글
로그인 상태 확인 중…
댓글 불러오는 중…