아티클 목록으로
음성·오디오

문자 번역을 넘어 실제 표현을 이해하는 다국어 음성 AI

약 3분 소요

들어가며

다국어 AI의 과제는 한 언어의 문장을 다른 언어로 바꾸는 데서 끝나지 않는다. 실제 대화에는 머뭇거림, 웃음, 겹쳐 말하기, 억양, 방언, 여러 언어를 섞는 현상이 자연스럽게 나타난다. 말의 속도와 감정도 의미를 바꿀 수 있다. Google은 최근 언어 AI 전략에서 음성을 먼저 문자로 바꾸는 기존 방식에서 벗어나, 소리와 발화 의도를 직접 다루는 모델로 나아가겠다는 방향을 제시했다.

핵심 내용

  • 오디오를 직접 이해하는 모델. 전통적인 음성 시스템은 음성을 텍스트로 전사하고, 텍스트를 처리한 뒤 다시 음성으로 합성하는 다단계 구조를 사용했다. 이 과정에서는 억양, 감정, 호흡과 문맥이 손실될 수 있다. Google은 Gemini가 음성을 직접 처리하도록 학습해, 불완전한 문장이나 소음, Spanglish와 Hinglish 같은 언어 혼용을 다루려 한다.
  • 실시간 대화가 주요 활용처다. Google에 따르면 Gemini 3.5 Live Translate는 70개 언어와 2,000개 이상의 언어 조합에서 실시간 음성 번역을 지원한다. Gemini 3.5 Transcribe는 소음과 전문 용어가 있는 환경을 겨냥하며, Android Gboard의 Rambler는 말버릇을 제거하고 문장부호를 고치며 음성 명령으로 내용을 다시 쓰도록 돕는다.
  • 언어 간 전이 학습으로 범위를 넓힌다. ‘1,000개 언어 이니셔티브’는 세계에서 많이 사용되는 1,000개 언어를 지원하려는 계획이다. 1,200만 시간의 오디오로 학습한 Universal Speech Model은 데이터가 풍부한 언어에서 발견한 패턴을 학습 데이터가 부족한 언어의 음성 이해에 활용한다.
  • 현지 커뮤니티가 데이터 수집에 참여한다. WAXAL은 사하라 이남 아프리카의 27개 언어를 다룬다. Project Vaani는 인도의 109개 언어에서 15만 5,000명 이상으로부터 3만 시간 넘는 음성을 수집했다. Amplify Initiative도 4개 대륙의 현지 전문가와 대학들과 함께 지역적 표현과 다중 양식 데이터를 기록한다.
  • 인터넷과 기기 제약을 고려한다. TranslateGemma는 55개 언어로 학습된 경량 번역 모델 제품군으로, 기기에서 효율적으로 실행되는 것을 목표로 한다. Viamo의 Ask Viamo Anything은 대화형 음성 응답 시스템을 통해 일반 피처폰에서도 Gemini 기반 음성 도우미를 사용할 수 있도록 지원한다.
  • 접근성을 언어 설계의 일부로 본다. Google은 50개 이상의 수어를 대상으로 Sign Language-to-Text도 개발하고 있다. Gboard와 Pixel 11의 Live Transcribe에서 수어를 문자로 입력하는 기능을 제공하며, 첫 단계는 미국 수어에서 영어로의 변환이다.

의미와 영향

이 전략의 핵심은 언어 포용성을 단순한 지원 언어 수로 판단하지 않는 데 있다. 제품에 특정 언어가 표시돼도 지역 발음, 혼합 언어, 비표준적인 말하기를 제대로 인식하지 못하면 사용자는 기술에 맞춰 말해야 한다. 오디오를 직접 처리하는 모델과 지역에서 수집한 데이터는 이러한 간극을 줄일 가능성이 있다.

다만 장기 과제도 분명하다. 언어 데이터 수집에는 이용자의 동의와 지역 공동체의 우선순위를 반영하는 절차가 필요하다. 성능 평가 역시 단어 인식률만으로는 부족하며, 모델이 문화적 맥락을 존중하는지와 제한된 하드웨어에서도 실용적인 품질을 내는지를 함께 확인해야 한다. 다국어 AI의 경쟁 기준은 얼마나 많은 언어를 나열하는가에서, 사람들이 평소의 방식대로 말하고 이해받을 수 있는가로 이동하고 있다.

출처: Google AI Blog

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
StepAudio 3 Realtime: 말하면서 생각하는 풀 듀플렉스 음성 모델
음성·오디오
cctest.ai
음성·오디오

StepAudio 3 Realtime: 말하면서 생각하는 풀 듀플렉스 음성 모델

StepAudio 3 Realtime은 ‘듣기·대화·사고·행동’의 연속 루프를 중심으로 설계된 오디오 언어 기반 모델입니다. 풍부한 음향 인식, 풀 듀플렉스 대화, 발화 중 병렬 추론, 비동기 도구 실행을 하나의 시스템으로 묶습니다.

더 보기
CCTest · Blog
Gemini 3.8 Live 공개, 대화하면서 작업하는 실시간 음성 AI
음성·오디오
cctest.ai
음성·오디오

Gemini 3.8 Live 공개, 대화하면서 작업하는 실시간 음성 AI

Google DeepMind가 실시간 음성 대화, 시각적 맥락 이해, 병렬 추론, 백그라운드 도구 실행을 강화한 Gemini 3.8 Live와 Extended Thinking을 공개했습니다. 두 모델은 개발자 API와 Workspace, Search, Gemini 서비스에 순차적으로 제공됩니다.

더 보기
CCTest · Blog
X-AuT, 점진적 증류로 음성 LLM 오디오 인코더 압축
음성·오디오
cctest.ai
음성·오디오

X-AuT, 점진적 증류로 음성 LLM 오디오 인코더 압축

X-AuT는 음성 대규모 언어 모델의 오디오 인코더 깊이를 줄이면서, 프루닝 이후 발생할 수 있는 삭제 오류와 조기 종료를 완화하는 프레임워크를 제안합니다. 행동 프로브, 표현 정렬, 교차 스케일 증류와 LoRA 미세 조정을 함께 사용합니다.

더 보기