GigaAM Multilingual:为小语种打造的开源语音基础模型
导语
多语种语音识别看似“语言越多越好”,但现实并不总是如此。头部语言占据了训练数据的大多数,长尾语言往往只能分到极少样本,导致模型在不同语言上的表现极不均衡。GigaAM Multilingual 试图回答一个更务实的问题:在数据分布严重失衡的情况下,能否为中亚这类资源稀缺语言做出真正可用的基础模型?
核心要点
- 模型定位明确:面向哈萨克语、吉尔吉斯语、乌兹别克语等低资源语言。
- 预训练规模大:采用 Conformer 编码器,在 200 万小时音频上用 HuBERT 风格目标进行自监督学习。
- 训练策略是重点:预训练阶段引入簇级别的数据均衡,微调阶段采用领域感知采样,降低头部语言主导效应。
- 效果有针对性:在目标语言上优于 Whisper Large v3 和 Omnilingual-1B,尤其在自然、口语化语音场景中提升更明显。
- 开源可复用:作者同时释放了基础编码器和 ASR 模型,便于后续迁移到新语言。
解读
这项工作的价值,不只在于“又训练了一个大模型”,而在于它把多语种语音识别里最常见的痛点摆到了台前:数据不平衡。很多通用 ASR 模型虽然覆盖语言更多,但真正轮到低资源语言时,性能往往掉得很快。GigaAM Multilingual 的思路是先把表示学习做扎实,再通过训练采样策略修正数据分布偏差,让模型不至于被高资源语言带跑。
从结果看,它在中亚语言上的相对 WER 降幅相当可观,说明对“少数据、弱资源”的场景,这类组合拳是有效的。更重要的是,论文强调模型只需要几小时标注数据就能适配新语言,这对现实部署很有意义:很多语言并没有大规模转写语料,但往往存在少量可用数据和大量未标注音频。
影响
如果说通用大模型解决的是“尽可能覆盖”,那么 GigaAM Multilingual 解决的是“覆盖之后如何真正用好”。它给出的不是一个抽象的 scaling 故事,而是一套更接近工程现实的 recipe:大规模自监督预训练、数据均衡、领域感知微调、开源发布。对希望把语音技术带到长尾语言社区的团队来说,这比单纯追求更大参数量更有参考价值。
评论
正在确认登录状态……
正在加载评论……