GradCuit:让大模型在测试时优化“内部推理”
导语
大模型推理能力的提升,过去常见路径是设计更好的提示词、采样更多候选答案、再用评分器重排,或在训练阶段继续微调。GradCuit 关注的是另一条路线:模型参数保持冻结,但在测试时为当前问题临时优化一组“内部连续状态”,让模型不是简单重新生成答案,而是调整自己在隐藏空间中的推理轨迹。
这篇论文的关键点在于,它把可优化的潜变量放进 Transformer 的中间层,位于提示词隐藏表示与后续生成内容之间。这样,后续每个 token 的对数概率,都能通过剩余 Transformer 层和因果自注意力,与前面的潜变量形成可微连接。换句话说,最终输出好不好,不再只能间接影响某些解码出来的文本,而可以通过梯度更直接地反馈到中间推理状态。
核心要点
- 测试时优化,不更新模型参数:GradCuit 面向单个输入实例优化潜在状态,基础大模型本身保持不变,因此更像是一种推理阶段的适配机制,而不是传统微调。
- 更直接的信用分配:以往潜变量推理方法往往通过已解码 token 与推理轨迹相连,序列级结果如何归因到内部状态并不清晰。GradCuit 通过“gradient through circuit”的设计,让整段续写的奖励加权梯度可以分配到潜变量。
- 跨模型与任务的收益:论文在五个指令微调骨干模型、三个推理基准和两种答案格式上测试,报告平均准确率为 64.5%,相比链式思维提示提升 6.6 个百分点,并比最强对比方法高 2.4 个百分点。
- 对超参数更稳健:在七组学习率设置下,GradCuit 持续优于 LatentSeek,并将准确率标准差从 1.53 降至 0.82。论文还提到,其随机游走变体也能与 LatentSeek 保持竞争力。
- 带来一定可解释性:通过 token 级梯度归因,作者观察到潜变量影响更集中在推理连接词等 token 上;层级分析则显示,早期到中间的 Transformer 层更适合作为优化空间。
意义与影响
GradCuit 的价值不只是“准确率又涨了一点”。它把测试时扩展从采样、重排和多轮自洽,推进到“优化内部推理状态”这一维度。对于需要复杂推理的任务,这种方法提供了一个有吸引力的设想:模型不必改变权重,也不必暴力生成大量候选,而是根据结果反馈在隐藏空间中微调当次推理过程。
同时,这类方法也提出了新的工程问题。测试时优化通常意味着额外计算开销,实际部署时需要权衡准确率、延迟和成本。它还依赖奖励或反馈信号的设计,反馈是否稳定、是否能泛化到开放式任务,都会影响实用价值。
从研究角度看,GradCuit 值得关注的地方在于它把性能提升、鲁棒性和可解释性放在同一框架下讨论。若后续工作能进一步降低推理成本,并验证其在更开放、更真实场景中的效果,测试时潜变量优化可能成为大模型推理增强的重要方向之一。
评论
正在确认登录状态……
正在加载评论……