返回文章列表
语音与音频

Gemini 3.8 Live 发布:实时语音对话开始进入“边聊边做”阶段

阅读约 3 分钟

导语

语音 AI 的竞争正在从“能不能听懂”转向“能否在对话不中断的情况下完成事情”。Google DeepMind 发布的 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,正是围绕这一方向推出的两款实时音频模型。前者强调规模化部署、对话流畅度和成本效率,后者则把重点放在复杂推理与多步骤任务执行上。

核心要点

  • 更接近自然对话的交互:Gemini 3.8 Live 支持实时视觉输入,可结合用户正在展示的画面回答问题;模型还能在对话中自动切换 97 种语言。
  • 对话与执行可以并行:模型能够在后台调用工具和 API,同时继续回应用户,不必等任务完成后才恢复交流。例如,语音代理可以一边确认请求,一边处理预订、查询或其他异步操作。
  • Extended Thinking 面向复杂工作流:该版本支持更深入的多步骤推理,并可通过“我来检查一下”等早期回应和进度说明,让用户了解任务仍在推进,而不是面对长时间沉默。
  • 覆盖多种实时场景:Google 展示了员工入职指导、实时排障、棋局分析、草图生成 React 组件、商业计划和营销工具包等案例。
  • 开发者生态正在接入:Gemini Live API 已与 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等平台形成合作或集成关系,帮助开发者处理实时媒体流基础设施。

性能与可用性

Google 表示,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 中取得 82.6 分,在 τ-Voice 和 Sierra 的 τ-Voice-banking 评测中分别达到 68.6% 和 35.1%,BigBench Audio 得分为 97.7%。Gemini 3.8 Live 则在 Speech Agent Arena 获得较高用户偏好。上述成绩来自官方披露,实际表现仍会受到任务类型、延迟、工具链和部署环境影响。

安全方面,Google 称其 AI 产品生成的音频均加入不可感知的 SynthID 水印,用于帮助识别 AI 生成内容。产品目前通过 Gemini API 和 Google AI Studio 向开发者开放,并在 Gemini Enterprise、Search Live、Gemini Live 及部分 Workspace 订阅中逐步推出。

意义与影响

这次更新的关键并不只是语音质量提升,而是把语音模型从“问答界面”进一步推向“可协作的任务入口”。实时视觉、后台工具调用和并行推理结合后,用户可以用更自然的表达持续推进任务,语音代理也更有机会进入客服、企业协作、培训和现场支持等场景。

不过,复杂任务中的准确性、工具调用的可控性、隐私保护以及成本,仍将决定这类系统能否稳定投入生产。Gemini 3.8 Live 的下一阶段竞争,将不只在模型能力,也在于开发平台能否提供可靠的延迟、监控和安全机制。

来源:Google DeepMind

评论

正在确认登录状态……

正在加载评论……

相关文章