返回文章列表
模型评测

模型向自己学习为何会失控:测试时训练的长期反馈陷阱

阅读约 3 分钟

导语

测试时训练(Test-Time Training,TTT)试图让模型在推理过程中更新自身权重,把当前输入中的信息暂时写入模型。它为长上下文适应、持续推理和个性化提供了新的路径,但也带来一个容易被忽略的问题:如果训练样本由模型自己生成,那么每次参数更新不仅改变了模型,也改变了下一批训练样本的生成者。

来自 KAUST 的研究《Self-Generated Feedback Destabilizes Test-Time Training》围绕这一闭环展开分析。研究者在最长 128K token 的数据流上,考察了多种 TTT-E2E 配置,并额外测试了对 Qwen3-4B 现有权重进行 Adam 更新的情形。

核心发现

  • 问题不只是“写入文本”本身。 在人类撰写的真实文本上进行同类更新,模型可以获得改善;但保留基于自身生成文本的更新后,模型在独立真实文本上的预测表现会恶化。
  • 自生成反馈是主要诱因。 让一个冻结的模型负责生成训练片段、再由可更新模型学习这些片段,在 125M 和 760M 配置上移除了超过 98% 的损害。这说明,关键风险来自“生成者随更新不断变化”的反馈回路,而非生成文本这一形式本身。
  • 局部拟合与泛化发生冲突。 配对的一次更新比较显示,更新后的模型更擅长预测作为训练来源的片段,却更不擅长预测新的真实文本。模型对来源数据的改进,不能直接代表适应成功。
  • 退化并非平均发生。 闭环适应后,风险会继续累积,少数轨迹贡献了大部分严重失败。这意味着平均指标可能掩盖少数但影响很大的不稳定路径。

如何缓解

研究提出了“Settlement”式的提交机制:先生成候选参数状态,再用独立真实文本检查其预测表现,只有通过验证的更新才被保留。实验中,这一做法在 125M 和 760M 配置下将最终差距控制在接近零的水平,同时保留了基于真实文本的适应收益。

意义与影响

这项工作给持续学习和推理时适应提出了一个重要约束:更新的价值必须在独立证据上评估,而不能只看训练来源上的损失是否下降。对未来的在线学习系统、长上下文模型和自主代理而言,参数更新不应被视为必然正确的写入操作,而应具备验证、拒绝和回滚机制。

研究并未说明所有自生成数据都会必然导致失败,也没有否定测试时训练的价值;它更准确地指出,长期闭环中的分布漂移和自我强化会让局部有效的更新逐渐偏离外部数据。如何设计更低成本的独立验证集、检测异常轨迹,并在不牺牲适应速度的情况下控制更新风险,将是后续研究的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章