返回文章列表
语音与音频

GigaAM Multilingual:为小语种打造的开源语音基础模型

阅读约 2 分钟

导语

多语种语音识别看似“语言越多越好”,但现实并不总是如此。头部语言占据了训练数据的大多数,长尾语言往往只能分到极少样本,导致模型在不同语言上的表现极不均衡。GigaAM Multilingual 试图回答一个更务实的问题:在数据分布严重失衡的情况下,能否为中亚这类资源稀缺语言做出真正可用的基础模型?

核心要点

  • 模型定位明确:面向哈萨克语、吉尔吉斯语、乌兹别克语等低资源语言。
  • 预训练规模大:采用 Conformer 编码器,在 200 万小时音频上用 HuBERT 风格目标进行自监督学习。
  • 训练策略是重点:预训练阶段引入簇级别的数据均衡,微调阶段采用领域感知采样,降低头部语言主导效应。
  • 效果有针对性:在目标语言上优于 Whisper Large v3 和 Omnilingual-1B,尤其在自然、口语化语音场景中提升更明显。
  • 开源可复用:作者同时释放了基础编码器和 ASR 模型,便于后续迁移到新语言。

解读

这项工作的价值,不只在于“又训练了一个大模型”,而在于它把多语种语音识别里最常见的痛点摆到了台前:数据不平衡。很多通用 ASR 模型虽然覆盖语言更多,但真正轮到低资源语言时,性能往往掉得很快。GigaAM Multilingual 的思路是先把表示学习做扎实,再通过训练采样策略修正数据分布偏差,让模型不至于被高资源语言带跑。

从结果看,它在中亚语言上的相对 WER 降幅相当可观,说明对“少数据、弱资源”的场景,这类组合拳是有效的。更重要的是,论文强调模型只需要几小时标注数据就能适配新语言,这对现实部署很有意义:很多语言并没有大规模转写语料,但往往存在少量可用数据和大量未标注音频。

影响

如果说通用大模型解决的是“尽可能覆盖”,那么 GigaAM Multilingual 解决的是“覆盖之后如何真正用好”。它给出的不是一个抽象的 scaling 故事,而是一套更接近工程现实的 recipe:大规模自监督预训练、数据均衡、领域感知微调、开源发布。对希望把语音技术带到长尾语言社区的团队来说,这比单纯追求更大参数量更有参考价值。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GigaChat Audio:把“时间”写进长音频理解的开源大模型
语音与音频
cctest.ai
语音与音频

GigaChat Audio:把“时间”写进长音频理解的开源大模型

这篇工作聚焦长录音中的时间定位问题,提出一种面向音频的时间感知 LLM,能够在最长 120 分钟的输入中给出带明确时间戳的回答,并支持片段描述与摘要生成。 它的核心思路,是把周期性的时间标记与连续音频 token 交错输入,再借助大规模合成监督训练。

阅读全文