아티클 목록으로
멀티모달

Gemini 3.8 Live, 실시간 아바타로 기업 대화를 시각화

약 3분 소요

개요

Google DeepMind가 Live Avatar를 탑재한 Gemini 3.8 Live를 발표했다. 이 기능은 실시간 음성 대화 모델에 저지연 영상 생성을 결합해 기업용 에이전트에 시각적 존재감을 더한다. 음성만 반환하는 기존 방식과 달리 사용자의 음성과 영상을 받아들이고, 말소리와 표정, 입 모양이 함께 움직이는 아바타로 응답하는 것이 핵심이다.

핵심 내용

  • 멀티모달 대화: 음성 및 시각 입력을 동시에 처리하고, 자연스러운 표정과 립싱크, 매끄러운 발화 전환을 구현하는 것을 목표로 한다. 고객 지원이나 제품 안내에서 일반적인 음성 봇보다 직관적인 상호작용을 제공하려는 접근이다.
  • 대화 중 비동기 작업: 비동기 도구 호출을 이용하면 데이터를 조회하거나 업무 시스템을 실행하는 동안에도 대화를 이어갈 수 있다. Google은 호텔 체크인 처리 과정에서 백그라운드 작업과 대화를 동시에 진행하는 예시를 제시했다.
  • 97개 언어 지원: 음성 대 음성 동기화를 지원하며, 대화 중 언어가 바뀌어도 입 모양과 표정을 조정한다. Google은 언어 전환 과정에서 영상 품질 저하나 시각적 흔들림을 줄이는 데 초점을 맞췄다고 설명한다.
  • 브랜드 맞춤형 캐릭터: 기본 아바타 라이브러리 외에도 고품질 참조 이미지로 맞춤 아바타를 만들 수 있다. 외형의 유사성, 브랜드 스타일, 캐릭터 정체성을 유지하도록 설계됐지만, 맞춤 생성 기능은 현재 기업 허용 목록을 통해서만 제공된다.
  • 생성 콘텐츠 식별: AI가 생성한 음성과 영상에는 보이지 않는 SynthID 워터마크가 삽입된다. 이를 통해 합성 콘텐츠의 탐지 가능성을 높이고 오정보나 잘못된 출처 표기를 줄이는 것이 목적이다.

의미와 영향

Live Avatar의 의미는 AI에 얼굴을 붙였다는 데만 있지 않다. 시각적 반응을 대화의 일부로 편입해 고객 서비스, 제품 시연, 교육, 사용 안내 등에서 정보를 전달하는 방식을 확장한다는 점이 중요하다. 음성과 입 모양, 표정이 자연스럽게 맞으면 긴 설명이나 단계별 안내를 보다 쉽게 따라갈 가능성이 있다.

비동기 도구 실행은 기업 환경에서 특히 실용적이다. 내부 시스템 조회나 업무 처리가 끝날 때까지 침묵하거나 같은 안내를 반복하는 대신, 에이전트가 대화의 흐름을 유지할 수 있기 때문이다. 다만 기업은 도구 권한, 실행 오류, 결과의 불확실성을 사용자에게 어떻게 알릴지 함께 설계해야 한다.

시각적 캐릭터는 새로운 위험도 만든다. 사용자가 에이전트의 능력을 과대평가하거나 합성 인물을 실제 사람으로 오해할 수 있다. SynthID가 출처 확인을 돕더라도 AI임을 명확히 알리는 표시와 접근 통제, 운영 정책을 대신할 수는 없다.

Gemini 3.8 Live with Live Avatar는 Gemini Enterprise에서 제공되며, 개발자는 API 문서를 통해 연동을 시작할 수 있다. 이번 발표는 기업용 AI가 단순히 답변하는 도구에서 벗어나, 정보를 조회하고 업무를 처리하는 동안에도 시각적으로 대화를 이어가는 에이전트로 발전하는 흐름을 보여준다.

출처: Google DeepMind

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PrismML, 퀄컴 스마트 글라스에 1비트 소형 모델 선보여
멀티모달
cctest.ai
멀티모달

PrismML, 퀄컴 스마트 글라스에 1비트 소형 모델 선보여

PrismML이 퀄컴 스냅드래곤 AR1 Gen 1 플랫폼 기반 스마트 글라스를 위한 1비트 Bonsai 언어 모델을 공개했다. 약 20억 개 파라미터의 비전·언어 모델로 기기 내 처리를 목표로 하지만, 실제 탑재 제품은 아직 발표되지 않았다.

더 보기
CCTest · Blog
Ovis-Embedding, 텍스트·이미지·영상·음성을 하나의 의미 공간으로
멀티모달
cctest.ai
멀티모달

Ovis-Embedding, 텍스트·이미지·영상·음성을 하나의 의미 공간으로

Ovis-Embedding은 공유 멀티모달 백본으로 텍스트, 이미지, 영상, 음성을 함께 인코딩하는 옴니모달 임베딩 방식을 제시한다. 데이터 구성, 어려운 샘플 학습, 유사도 증류, 추론 차원 조절을 하나의 설계로 묶은 것이 핵심이다.

더 보기