返回文章列表
大语言模型

让模型用用户的语言思考:多语数据混合如何推动跨语言推理

阅读约 3 分钟

导语

许多推理模型虽然能够处理中文、阿拉伯语或其他非英语提示,但生成思路时仍会不自觉地切换到英语,最后再返回目标语言。这种“英语中间层”未必总会降低答案准确率,却可能削弱表达的自然性,遗漏只在目标语言和文化语境中更容易呈现的信息,也让用户难以判断模型是否真正理解了问题。

Cohere Labs 发布的研究把注意力集中在一个更具体的目标上:让模型始终使用用户提问的语言进行推理,即所谓 L2 reasoning。研究并非主要依赖更大的模型规模,而是从监督微调(SFT)的数据配比和训练安排入手,探索推理能力如何跨语言迁移。

核心要点

  • 模型与覆盖范围:研究构建了 3.35B 参数的 Tiny Aya L2-Thinker,并在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六类基准上进行评估。
  • 语言内推理表现:摘要称,该模型在 60 种语言上取得超过 93% 的语言内推理率,同时保持较强的任务表现。这里的重点不仅是“能答对”,还包括推理过程与提示语言保持一致。
  • 数据混合是关键变量:研究发现,扩大训练数据的语言覆盖,比单纯为每种语言准备大量推理样本更重要。多语非推理数据也能帮助模型建立语言表达能力和任务适应能力。
  • 英语推理能力仍有价值:英语推理数据并没有被排除。一个足够强的英语推理骨干,配合多语数据,似乎能够把相对语言无关的推理行为迁移到不同语言。
  • 可推广到未见语言:研究提出,经过合理的数据混合,模型甚至有机会将 L2 推理泛化到训练阶段未直接覆盖的语言,说明语言覆盖的广度可能比逐语言配备完整推理标注更具效率。

意义与影响

这项工作对多语模型训练提供了一个务实方向:问题不一定是每种语言都缺少推理能力,而可能是训练过程默认了“推理应当用英语完成”。如果推理被视为一种可以跨语言迁移的行为,那么数据设计就不必局限于为每种语言复制一套完整的思维链语料,而可以将英语推理、多语普通文本和有限的多语推理数据组合起来。

这也降低了低资源语言参与推理模型训练的门槛。不过,“语言内推理率”与事实准确性、文化适切性和复杂任务能力并不是同一个指标,超过 93% 的结果也不能直接等同于所有语言上的全面领先。未来仍需要更细致地比较不同语言、不同资源水平和不同文化任务中的质量差异。

研究团队同时公开了 Tiny Aya L2-Thinker、Tiny Aya En-Thinker 的模型权重,以及覆盖 44 种语言的多语推理数据,为复现实验和进一步研究数据配比提供了基础。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念
大语言模型
cctest.ai
大语言模型

NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念

NCP-ArchPreview在传统下一词预测之外,引入覆盖多个词元的下一概念预测,将离散概念空间纳入语言模型训练。技术报告显示,该8.9B参数模型在更少训练词元和计算量下取得了具有竞争力的预训练与下游表现。

阅读全文
CCTest · Blog
大模型为何会回答无解问题?研究发现关键不在“不会识别”
大语言模型
cctest.ai
大语言模型

大模型为何会回答无解问题?研究发现关键不在“不会识别”

一项针对1.7B至70B规模指令模型的研究发现,模型往往已经在内部识别出数学和代码问题的结构性不可解,却没有把这一信号路由为拒答行为。问题更像是“识别—行动”之间的错配,而非能力缺失。

阅读全文