Transformer为何“过早停止思考”?一层小型LoRA让推理链延伸数十步
导语
Transformer的层数很多,并不意味着它会在每个任务上用完整个深度。一篇发表于Hugging Face Daily Papers的新研究指出,在不要求模型输出思维链、只需直接给出答案的条件下,多个预训练模型面对简单的引用链时,往往只进行很短的计算。
例如,程序可以写成“K = apple; B = K; D = B; print(D)”。模型需要沿着变量之间的关系逐步回溯,才能得到最终答案。研究者测试了13个、参数规模从0.6B到32B的基础模型,发现它们通常只能稳定跟踪1.4至3.6行。即使增加预训练模型的深度,能力也没有相应延伸。
核心发现
- 小改动带来大幅提升。 在Qwen3-8B的一个早期层加入rank-8 LoRA,并冻结其余权重后,模型在24行引用链上的精确匹配率由15.5%升至99%。这个LoRA只有65,537个参数;训练时间更长的版本还能在一次前向传播中处理50行。
- 关键不只是“记住答案”。 LoRA本身逐token工作,不负责在不同token之间搬运信息。研究结果显示,它更像是启动了一个计算接力:程序行的链身份在冻结的第16至22层之间逐步传递,后续注意力头则能读取更远处的祖先节点。
- 层的位置存在断崖。 同样的训练方法放在第20层时,模型平均可处理约20.5行;移动到第21层后,能力降至约5.2行。研究者还用冻结模型上的测量方法,在4个留出模型中的3个定位了这一干预边界,并落在预先设定的容差内。
- 循环结构可以继续放大效果。 在Ouro-1.4B上,每次循环都施加LoRA后,4次循环可处理60行,8次循环至少可处理160行的双链选择任务。
- 并非只对合成任务有效。 针对MuSiQue多跳问答分别训练的早期层LoRA,在三个标准模型上带来了9.4至17.9个百分点的精确匹配提升,但实验使用了给定的金标准段落。
意义与局限
这项工作的核心启示是:模型的默认答案可能低估了其可用计算能力。问题不一定是后半段网络无法表示长链推理,而可能是早期层没有把合适的状态交给后续层,导致计算“过早停止”。一个极小的参数高效编辑,可能重新打开原本闲置的深度。
不过,这并不等于LoRA已经解决了通用推理。实验重点是引用链和特定的多跳问答设置,效果依赖插入层位置、训练任务与模型结构;合成链上的精确率也不能直接代表开放领域可靠性。更值得关注的是,研究提供了一种诊断思路:先测量模型在哪一层失去有效计算,再进行定点干预,而不是盲目扩大模型或增加所有层的训练参数。
评论
正在确认登录状态……
正在加载评论……