模型不会“教代码”,却能把编码能力传给另一个模型
导语
如果一个模型从未见过代码,只接收另一个模型对无关问题给出的单个单词,它还能学会编程吗?来自北京大学的研究给出了肯定但仍需谨慎理解的答案:后训练带来的能力变化,可能会以极其微弱的方式扩散到与目标任务无关的输出中。
论文提出了“主动无任务蒸馏”(Active Taskless Distillation,ATD)。它研究的不是教师模型直接回答编程题,而是教师在普通提示下做出的细小词语选择。研究者先找到一些提示:共享基础模型在两个普通单词之间几乎没有偏好。随后,他们比较经过目标能力后训练的教师模型在这些位置上的选择,并把提示和单词组成训练数据,交给从同一基础模型初始化的学生模型。
核心要点
- 监督信号极其简短。 学生只看到提示和教师选出的一个单词,不接触代码、目标任务示例、教师参数或完整logits。
- 关键在于“近乎犹豫”的位置。 当基础模型本来就在两个词之间势均力敌时,后训练造成的微小概率变化更容易被识别和放大。
- 编码能力出现了迁移。 在Qwen2.5-1.5B的主要实验中,5664组单词级样本相较于严格匹配的干扰对照,使HumanEval+成绩提高5.34个百分点。
- 现象并非只限于代码。 研究还报告了科学知识、常识推理和阅读理解方向上的迁移,并在不同模型规模、模型家族和后训练版本中观察到类似结果。
- 能力信号具有组合性。 功能分析显示,学生获得的变化可以与其他能力结合;迁移强度还会随教师更新幅度变化。
这意味着什么
这项工作把此前关于“潜意识学习”或偏好传播的讨论,推进到了能力层面。后训练并不只改变模型在明确任务上的答案,也可能重塑大量看似无关的微小决策。单个单词几乎没有信息量,但成千上万次有针对性的选择,可能共同携带关于模型更新方向的痕迹。
对模型开发者而言,这提示能力评估不能只关注目标数据集,也应检查后训练前后在无关提示上的行为差异。对模型安全和知识产权而言,研究也提出了新的问题:模型能力是否能通过低带宽、难以察觉的输出被间接提取或传播?
不过,现有素材主要给出了方法与代表性结果,尚不足以判断这种迁移在更大模型、不同训练配方或更强对抗环境中的稳定性。ATD更像是揭示后训练“行为阴影”的实验工具,而不是无需任务数据即可普遍复制能力的完整方案。
评论
正在确认登录状态……
正在加载评论……