返回文章列表
多模态

Gemini 3.8 Live加入实时头像,企业对话走向“可视化”

阅读约 3 分钟

导语

Google DeepMind宣布推出带Live Avatar的Gemini 3.8 Live。与只输出语音的实时助手不同,这一版本把实时对话能力与低延迟视频生成结合起来,让企业智能体拥有可持续互动的视觉形象。官方将其定位为面向客服、引导和其他企业场景的更自然交互方式。

核心要点

  • 语音、视觉与表情协同:Live Avatar能够同时处理视觉和音频输入,并以语音、视频和动态表情回应。系统强调口型同步、自然表情以及更流畅的轮流发言,从而减少传统语音机器人“只闻其声”的距离感。
  • 对话不中断地执行任务:借助异步工具调用,智能体可以在后台查询数据或触发业务工具,同时继续与用户交流。官方以酒店入住办理为例,展示了在任务处理期间保持对话连续性的方式。
  • 面向多语言场景:Live Avatar支持语音到语音的多语言同步,可在97种语言之间切换,并动态调整口型和表情。Google表示,这种切换旨在避免视频质量下降或出现明显的视觉漂移。
  • 支持品牌化形象:除预设头像库外,企业可以基于高质量参考图生成具有动画响应能力的头像,并尽量保留人物相似度、品牌风格或角色身份。不过,定制头像目前仅通过企业许可名单提供。
  • 加入内容溯源机制:Google称,相关音频和视频输出会嵌入不可见的SynthID水印,以帮助识别AI生成内容,降低误传和错误归因风险。

意义与影响

Live Avatar的重点不只是让虚拟形象“会说话”,而是把实时视觉反馈纳入企业智能体的交互循环。对于客户服务、产品演示、培训和操作引导等场景,表情、注视感和口型同步可能提升信息传达的直观性,也有助于让长时间对话更接近面对面交流。

更值得关注的是异步工具执行。企业助手如果必须等待后台系统返回结果,往往会出现沉默或重复提示;让智能体继续维持对话,可以改善等待阶段的体验。不过,这也意味着企业需要进一步处理工具权限、结果准确性和用户知情等问题。视觉化形象还会带来身份误认与过度拟人化风险,因此水印和透明度机制只是基础,实际部署仍需配合清晰的AI标识与治理流程。

目前该功能已在Gemini Enterprise中提供,开发者可参考API文档接入。整体来看,Live Avatar展示了多模态模型从“实时回答”向“持续在场”演进的方向,但其商业价值仍取决于企业能否把头像、工具和业务流程真正结合起来。

来源:Google DeepMind

评论

正在确认登录状态……

正在加载评论……

相关文章