让模型用用户的语言思考:多语数据混合如何推动跨语言推理
导语
许多推理模型虽然能够处理中文、阿拉伯语或其他非英语提示,但生成思路时仍会不自觉地切换到英语,最后再返回目标语言。这种“英语中间层”未必总会降低答案准确率,却可能削弱表达的自然性,遗漏只在目标语言和文化语境中更容易呈现的信息,也让用户难以判断模型是否真正理解了问题。
Cohere Labs 发布的研究把注意力集中在一个更具体的目标上:让模型始终使用用户提问的语言进行推理,即所谓 L2 reasoning。研究并非主要依赖更大的模型规模,而是从监督微调(SFT)的数据配比和训练安排入手,探索推理能力如何跨语言迁移。
核心要点
- 模型与覆盖范围:研究构建了 3.35B 参数的 Tiny Aya L2-Thinker,并在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六类基准上进行评估。
- 语言内推理表现:摘要称,该模型在 60 种语言上取得超过 93% 的语言内推理率,同时保持较强的任务表现。这里的重点不仅是“能答对”,还包括推理过程与提示语言保持一致。
- 数据混合是关键变量:研究发现,扩大训练数据的语言覆盖,比单纯为每种语言准备大量推理样本更重要。多语非推理数据也能帮助模型建立语言表达能力和任务适应能力。
- 英语推理能力仍有价值:英语推理数据并没有被排除。一个足够强的英语推理骨干,配合多语数据,似乎能够把相对语言无关的推理行为迁移到不同语言。
- 可推广到未见语言:研究提出,经过合理的数据混合,模型甚至有机会将 L2 推理泛化到训练阶段未直接覆盖的语言,说明语言覆盖的广度可能比逐语言配备完整推理标注更具效率。
意义与影响
这项工作对多语模型训练提供了一个务实方向:问题不一定是每种语言都缺少推理能力,而可能是训练过程默认了“推理应当用英语完成”。如果推理被视为一种可以跨语言迁移的行为,那么数据设计就不必局限于为每种语言复制一套完整的思维链语料,而可以将英语推理、多语普通文本和有限的多语推理数据组合起来。
这也降低了低资源语言参与推理模型训练的门槛。不过,“语言内推理率”与事实准确性、文化适切性和复杂任务能力并不是同一个指标,超过 93% 的结果也不能直接等同于所有语言上的全面领先。未来仍需要更细致地比较不同语言、不同资源水平和不同文化任务中的质量差异。
研究团队同时公开了 Tiny Aya L2-Thinker、Tiny Aya En-Thinker 的模型权重,以及覆盖 44 种语言的多语推理数据,为复现实验和进一步研究数据配比提供了基础。
评论
正在确认登录状态……
正在加载评论……