返回文章列表
框架与工具

Modular TTT:把测试时训练拆成可组合模块

阅读约 2 分钟

Test-Time Training(TTT)常被看作一种在线学习式的序列建模思路:模型在推理阶段也会通过内部学习规则更新“快权重”,从而适应当前上下文。但问题在于,过去很多 TTT 变体都是各自硬编码实现,研究者很难快速拼装新方法,也不容易判断到底是网络结构、损失函数,还是更新规则在影响结果。

Modular TTT 的核心思路,是把 TTT 从“单个特例”改造成“模块化系统”。作者将内层学习器表示为一个有向无环图,并把以下部分拆开成独立设计维度:

  • 快权重网络
  • 损失函数
  • 学习率
  • 权重衰减
  • 归一化

在实现层面,框架会自动组合 train-view forward、train-view backward 和 causal query-view 等基础规则,形成完整的图级 TTT 计算,并显式处理快权重状态迁移。这样做的意义在于,研究者可以更直接地比较不同组件组合的效果,而不必在单一代码路径里反复改写。

更重要的是,这套框架让作者能够系统地做消融分析。结果显示,较小的学习率初始化、权重衰减,以及单层非线性通常更有帮助;MSE 和内积损失的表现则相近。相反,更深的快权重网络和归一化往往会带来过大的激活,反而伤害性能。残差连接和 gating 的收益也不明显。

这些发现的价值不只在“找到更好配置”,还在于为 TTT 提供了一种更像工程搭积木的研究方式:先把变量拆开,再讨论哪些部件真正必要,哪些只是复杂化实现。基于这套经验,作者进一步训练了 410M 和 1.45B 参数模型、使用 100B tokens,得到的训练损失和基准表现与 Gated DeltaNet 接近,说明模块化设计并没有牺牲整体竞争力。

从行业角度看,这篇工作的意义在于把 TTT 从“方法名词集合”推进到“可复用设计空间”。如果后续研究者能继续沿着这种模块化思路迭代,TTT 可能会更容易成为一种可比较、可调试、可扩展的序列建模范式。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章