返回文章列表
大语言模型

GradCuit:让大模型在测试时优化“内部推理”

阅读约 3 分钟

导语

大模型推理能力的提升,过去常见路径是设计更好的提示词、采样更多候选答案、再用评分器重排,或在训练阶段继续微调。GradCuit 关注的是另一条路线:模型参数保持冻结,但在测试时为当前问题临时优化一组“内部连续状态”,让模型不是简单重新生成答案,而是调整自己在隐藏空间中的推理轨迹。

这篇论文的关键点在于,它把可优化的潜变量放进 Transformer 的中间层,位于提示词隐藏表示与后续生成内容之间。这样,后续每个 token 的对数概率,都能通过剩余 Transformer 层和因果自注意力,与前面的潜变量形成可微连接。换句话说,最终输出好不好,不再只能间接影响某些解码出来的文本,而可以通过梯度更直接地反馈到中间推理状态。

核心要点

  • 测试时优化,不更新模型参数:GradCuit 面向单个输入实例优化潜在状态,基础大模型本身保持不变,因此更像是一种推理阶段的适配机制,而不是传统微调。
  • 更直接的信用分配:以往潜变量推理方法往往通过已解码 token 与推理轨迹相连,序列级结果如何归因到内部状态并不清晰。GradCuit 通过“gradient through circuit”的设计,让整段续写的奖励加权梯度可以分配到潜变量。
  • 跨模型与任务的收益:论文在五个指令微调骨干模型、三个推理基准和两种答案格式上测试,报告平均准确率为 64.5%,相比链式思维提示提升 6.6 个百分点,并比最强对比方法高 2.4 个百分点。
  • 对超参数更稳健:在七组学习率设置下,GradCuit 持续优于 LatentSeek,并将准确率标准差从 1.53 降至 0.82。论文还提到,其随机游走变体也能与 LatentSeek 保持竞争力。
  • 带来一定可解释性:通过 token 级梯度归因,作者观察到潜变量影响更集中在推理连接词等 token 上;层级分析则显示,早期到中间的 Transformer 层更适合作为优化空间。

意义与影响

GradCuit 的价值不只是“准确率又涨了一点”。它把测试时扩展从采样、重排和多轮自洽,推进到“优化内部推理状态”这一维度。对于需要复杂推理的任务,这种方法提供了一个有吸引力的设想:模型不必改变权重,也不必暴力生成大量候选,而是根据结果反馈在隐藏空间中微调当次推理过程。

同时,这类方法也提出了新的工程问题。测试时优化通常意味着额外计算开销,实际部署时需要权衡准确率、延迟和成本。它还依赖奖励或反馈信号的设计,反馈是否稳定、是否能泛化到开放式任务,都会影响实用价值。

从研究角度看,GradCuit 值得关注的地方在于它把性能提升、鲁棒性和可解释性放在同一框架下讨论。若后续工作能进一步降低推理成本,并验证其在更开放、更真实场景中的效果,测试时潜变量优化可能成为大模型推理增强的重要方向之一。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Multi-Head Attention Residuals:让 Transformer 的残差通路也拥有多头路由
大语言模型
cctest.ai
大语言模型

Multi-Head Attention Residuals:让 Transformer 的残差通路也拥有多头路由

这篇论文提出 Multi-Head Attention Residuals(MHAR),试图解决 Transformer 残差流只能以单一方式读取深度历史的问题。它用按特征子空间拆分的多头 softmax 做层间路由,在几乎不增加参数和计算的情况下改善验证损失。

阅读全文
CCTest · Blog
TOPL:把后训练改写成“逐 token 判断”,提升分布偏移下的忠实生成
大语言模型
cctest.ai
大语言模型

TOPL:把后训练改写成“逐 token 判断”,提升分布偏移下的忠实生成

这项工作提出了一种新的离策略后训练方法 TOPL,不是直接教模型“照着错误输出学”,而是让模型学会判断每个 token 是否正确。结果表明,它在摘要和翻译等忠实生成任务上,都展现出更强的跨数据集泛化能力。

阅读全文