返回文章列表
语音与音频

从翻译文字到理解表达:Google押注多语言语音AI

阅读约 3 分钟

导语

对多语言AI而言,真正的难题并不只是把一句话换成另一种语言。人们说话时会停顿、重复、夹杂方言和外语,也会通过语调、节奏和情绪传递含义。Google最新公布的语言AI路线,正试图让模型从“处理转写文本”走向“直接理解声音与表达”。

核心要点

  • 从文本管线转向原生音频理解。 传统语音系统通常先把声音转成文字,再处理文字并合成为语音,这一流程容易丢失语气、重音、情绪和上下文。Google称,Gemini模型正在直接处理音频,以应对多人交谈、非完整句子以及Spanglish、Hinglish等混合语言场景。
  • 实时交互与语音编辑成为应用入口。 Gemini 3.5 Live Translate面向70种语言和超过2000个语言对提供实时口语翻译;Gemini 3.5 Transcribe则针对噪声环境和专业术语优化转写。Android Gboard中的Rambler还可去除口头语、修正标点,并通过语音命令改写内容。
  • 以跨语言学习扩大覆盖面。 Google的“1000种语言计划”希望覆盖全球最常用的1000种语言。其Universal Speech Model使用1200万小时音频训练,并通过跨语言迁移,让数据丰富语言中学到的模式帮助资源稀缺语言提升语音理解能力。
  • 数据采集更多依赖本地社区。 WAXAL覆盖27种撒哈拉以南非洲语言;Project Vaani已从109种印度语言、超过15.5万名说话者收集超过3万小时语音;Amplify Initiative则联合四大洲的本地专家和大学,记录多模态语言信息。此类合作有助于保留声调、地区差异和真实对话节奏。
  • 把可用性延伸到低连接环境。 TranslateGemma是一组面向55种语言的轻量翻译模型,可在设备端运行,降低对云端网络的依赖。针对功能机用户,Viamo的Ask Viamo Anything已在卢旺达试点,并通过交互式语音服务回答了超过200万个问题。
  • 无障碍不应只是附加功能。 Google还在推进Sign Language-to-Text,覆盖50多种手语,为Gboard和Pixel 11上的Live Transcribe提供手语转文字能力,首阶段从美国手语到英语开始。

意义与影响

这套路线的价值,在于它把语言覆盖问题拆成了几个同时存在的技术问题:模型是否听得懂,数据是否反映当地表达,设备是否跑得动,以及不同身体条件的人能否使用。仅扩大翻译语言数量,未必能解决方言、混合语言和非标准语音带来的误识别;本地数据合作与原生音频建模,则可能改善这些细节。

不过,覆盖1000种语言仍然意味着长期的数据、评测和社区治理工作。语言数据如何获得授权、模型是否真正尊重文化语境,以及离线模型在低端设备上的质量如何保持,都需要持续验证。对行业而言,Google的布局显示,多语言AI的竞争焦点正在从“支持多少种语言”转向“能否在真实生活中准确、平等地理解人”。

来源:Google AI Blog

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Gemini 3.8 Live 发布:实时语音对话开始进入“边聊边做”阶段
语音与音频
cctest.ai
语音与音频

Gemini 3.8 Live 发布:实时语音对话开始进入“边聊边做”阶段

Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,重点提升实时语音交互、视觉理解、并行推理与后台工具调用能力。两款模型面向不同复杂度的语音代理任务,并已通过 API、Workspace、Search 和 Gemini 应用逐步开放。

阅读全文