低资源语言推理:SFT改变表达,RL修补行为,而准确率看不见
导语
把模型“训练成会用某种语言推理”,不能只看最终答对了多少题。一项以希腊语为案例的研究显示,低资源语言适配最重要的变化,可能发生在准确率指标之外:模型是否用用户看得懂的语言展开推理,是否遵守输出格式,以及是否能按指令切换推理语言。
研究团队选取了多个混合专家模型,单个模型约有3.6B至4.0B有效激活参数,并通过监督微调(SFT)和带可验证奖励的强化学习(RLVR)进行适配。研究还专门检查了评测工具自身是否可靠,并为行为指标设置了控制条件,以排除“只是输出更长”造成的假象。
核心发现
- 准确率的“无变化”可能是噪声。 在这组实验中,模型整体准确率几乎没有明显提升,但仅仅更换随机种子,就能带来7.7个百分点的波动。这一幅度高于研究中观察到的多数数据和训练配方差异,说明在这一规模和任务设置下,单看准确率很难判断语言适配是否成功。
- 基础模型并不会自然用希腊语思考。 在抽查的1000条推理轨迹中,基础模型没有一条使用希腊语推理,即使题目本身是希腊语。模型或许仍能给出正确答案,但用户无法阅读、审计或纠正其推理过程。
- SFT首先改变了表达习惯。 微调后的检查点在约98%的样本中使用与问题相同的语言推理,其中一个模型系列在更少的词元下完成推理。四个模型的语法表现均有所改善,而通用能力与基础模型只相差几个百分点,暂未显示出明显的能力遗忘。
- SFT不是行为控制的终点。 约四分之一的回答没有遵守指定格式,部分答案泄漏到推理通道;面对“用英语思考”的明确指令,模型的服从率还不到一半。这些问题说明,学会用目标语言表达,与稳定遵守交互协议是两件事。
- RLVR更擅长修补可验证行为。 预先注册的强化学习实验将格式回退率从24%降至2.5%,推理通道泄漏率从3.5%降至0%;要求用英语思考的指令服从度则提升9.1个百分点。相比之下,只优化准确率的梯度并没有改变模型已经形成的希腊语推理习惯。
为什么重要
这项工作把“多语言能力”拆成了几个更具体的问题:模型能不能答对、能不能用目标语言推理、推理是否通顺、是否遵守格式、是否把答案放在正确通道,以及能否根据指令切换语言。对于低资源语言用户而言,后几项直接关系到可理解性、可审计性和实际可用性。
研究还提醒评测者,新的行为指标同样可能误导。作者报告了六种测量失败,并用控制实验逐一识别,例如指标可能把更长的输出误判为更好的推理。因此,未来的语言适配评估不应只增加一个“语言正确率”,而应同时报告长度控制、随机种子波动、通用能力保持情况和指令服从度。
希腊语在这里更像一个可测量的实验场,而不是研究终点。对于其他低资源语言,SFT可能负责让模型“开口说对语言”,RL则负责让它在复杂交互中“按规则行动”。两者共同构成的,才是可读、可控且可验证的语言推理系统。
评论
正在确认登录状态……
正在加载评论……