아티클 목록으로
음성·오디오

샤오미, 목표 화자에 집중하는 음성 인식 모델 CocktailASR-1 공개

약 3분 소요

자동 음성 인식은 주변이 조용하고 한 사람의 목소리가 선명할 때 비교적 안정적으로 작동합니다. 그러나 회의나 모임처럼 여러 사람이 동시에 말하는 환경에서는 문제가 달라집니다. 시스템은 소리를 문자로 바꾸는 데 그치지 않고, 섞여 있는 음성 가운데 누가 말했는지 구분한 뒤 어느 사람의 발화를 인식할지 선택해야 합니다. 음성 처리 분야에서 오랫동안 논의된 ‘칵테일 파티 문제’가 바로 이 상황을 가리킵니다.

샤오미가 공개한 CocktailASR-1은 목표 화자 음성 인식을 중심으로 이 문제에 접근합니다. 공개된 설명에 따르면 핵심은 단순히 더 강력한 소음 제거를 적용하는 것이 아닙니다. 먼저 사용자가 듣고 싶은 화자에 대한 정보를 제공하고, 이후 혼합된 음성에서 해당 화자의 발화를 추적해 인식하며 다른 사람의 말은 가능한 한 출력하지 않는 방식입니다.

핵심 내용

  • 겹쳐 말하는 상황을 겨냥: 한 명이 말하는 일반적인 받아쓰기보다 여러 사람이 동시에 발화하는 환경에 초점을 둡니다.
  • 화자 지정 정보를 활용: 누구의 목소리를 따라갈지 정하는 정보를 음성 인식 과정의 조건으로 사용합니다.
  • 일반적인 소음 제거와 구별: 소음 제거가 불필요한 소리를 억제한다면, 목표 화자 인식은 그중 누구의 목소리를 남겨야 하는지를 먼저 결정합니다.
  • 실제 적용을 염두에 둔 공개: 샤오미는 이 모델을 산업용 목표 화자 음성 인식 모델로 소개하고 오픈소스로 공개했습니다.

이 방식의 의미는 모든 소리를 한꺼번에 분리하려는 문제를 조건부 인식 문제로 바꾼다는 데 있습니다. 실제 사용자는 방 안의 모든 사람에 대한 대화록을 원하는 것이 아닐 수 있습니다. 회의에서 특정 참가자의 발언만 따라가거나, 그룹 통화에서 한 사람의 말만 확인하거나, 주변 소음 속에서 특정 사용자의 명령을 인식하려는 경우에는 목표를 좁히는 것이 더 유용할 수 있습니다.

다만 이 접근만으로 칵테일 파티 문제가 해결됐다고 보기는 어렵습니다. 목표 화자 정보를 어떻게 제공하는지, 화자가 잠시 말을 멈춘 뒤에도 동일한 인물을 계속 추적할 수 있는지, 목소리가 비슷한 사람이나 잦은 끼어들기에 어떻게 대응하는지는 여전히 중요한 과제입니다. 현재 확인 가능한 자료에는 CocktailASR-1의 구체적인 구조, 학습 데이터, 평가 결과, 오픈소스 라이선스가 제시되어 있지 않습니다. 따라서 지금 단계에서 종합적인 성능이나 적용 범위를 단정하기보다는 하나의 유의미한 기술 방향으로 보는 편이 타당합니다.

이번 공개가 보여주는 더 큰 흐름은 음성 인식이 ‘들리는 모든 것을 받아쓰는 기술’에서 ‘사용자가 실제로 듣고 싶은 음성을 이해하는 기술’로 확장되고 있다는 점입니다. 회의 기록, 청각 보조, 차량용 대화, 이어폰, 공공장소의 음성 인터페이스 등에서 활용 가능성을 생각해볼 수 있습니다. 실제 영향력은 독립적인 평가와 재현성 검증, 다양한 음향 환경에서의 테스트에 달려 있습니다.

출처: OSChina

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
X-AuT, 점진적 증류로 음성 LLM 오디오 인코더 압축
음성·오디오
cctest.ai
음성·오디오

X-AuT, 점진적 증류로 음성 LLM 오디오 인코더 압축

X-AuT는 음성 대규모 언어 모델의 오디오 인코더 깊이를 줄이면서, 프루닝 이후 발생할 수 있는 삭제 오류와 조기 종료를 완화하는 프레임워크를 제안합니다. 행동 프로브, 표현 정렬, 교차 스케일 증류와 LoRA 미세 조정을 함께 사용합니다.

더 보기
CCTest · Blog
뇌 신호를 의미로 바꾼 뒤 텍스트로: 비침습 음성 디코딩의 새로운 경로
음성·오디오
cctest.ai
음성·오디오

뇌 신호를 의미로 바꾼 뒤 텍스트로: 비침습 음성 디코딩의 새로운 경로

Brain2Semantics2Text는 문장 수준의 MEG 반응을 먼저 의미 임베딩 공간으로 매핑한 뒤 자연어를 생성한다. 음소와 단어를 하나씩 복원하기보다 문장 전체의 의미를 우선하는 접근이다.

더 보기
CCTest · Blog
Pocket FM, AI로 오디오 콘텐츠 확장하며 연환산 매출 5억 달러 달성
음성·오디오
cctest.ai
음성·오디오

Pocket FM, AI로 오디오 콘텐츠 확장하며 연환산 매출 5억 달러 달성

인도의 오디오 스토리 플랫폼 Pocket FM이 1년 만에 연환산 매출 런레이트를 5억 달러로 두 배 늘렸다고 밝혔습니다. 전체 카탈로그의 93%, 신규 콘텐츠의 99%에 AI를 활용하지만 핵심 아이디어와 스토리 개발은 여전히 사람이 담당합니다.

더 보기