返回文章列表
模型评测

Recurrent Looped Transformer:让Transformer的计算深度随序列增长

阅读约 3 分钟

导语

Transformer擅长并行处理序列,但它对每个token使用的网络深度通常是固定的。对于奇偶校验、状态机模拟或置换跟踪这类任务,输入越长,模型往往越需要反复更新内部状态。固定深度的计算路径因此可能成为长度外推的瓶颈。

论文提出 Recurrent Looped Transformer(RLT),试图在不让每个token承担更高固定成本的前提下,引入随序列推进而增长的计算路径。

核心机制:并行编码与递归反馈

RLT将总共八层网络拆成两部分:前半部分是并行的因果编码器,负责从当前输入及其历史中提取表示;后半部分是递归解码器,在处理当前token时,将编码器输出与前一个token完成的解码状态合并。

因此,信息不只是经过固定数量的层,还会沿着token顺序逐步传递。序列越长,状态经历的递归更新次数越多,但单个token的局部计算预算保持在相对固定的范围内。这种设计也允许研究者通过改变编码器和解码器的层数比例,观察并行表示能力与递归状态能力之间的权衡。

实验结果

论文在六类算法任务上比较了五种八层RLT配置,并与八层标准Transformer对照,所有结果基于三个随机种子。

  • 奇偶校验: 模型最多在40位数据上训练时,两个RLT配置仍能将能力外推到256位,并在每个种子上达到100%准确率;标准Transformer基本停留在随机水平。
  • S_5置换跟踪: 在训练长度八倍的测试长度上,RLT最终状态准确率达到97%,标准Transformer低于1%。同时,解码器更深的配置通常表现更好。
  • 模运算: 在超出训练长度的测试中,RLT最高达到93%,标准Transformer为33%。
  • 反馈消融: 移除递归反馈后,奇偶校验和置换跟踪性能在所有层数划分下都降至随机水平,说明反馈并非附属模块,而是泛化能力的核心来源。

并行性与状态精度的取舍

作者还测试了每四个token更新一次反馈的分块方案。这样,已知输入可以在块内并行处理;在64位奇偶校验上,准确率仍可达到99%。但对需要逐步更新状态的置换跟踪,分块会带来明显损失:长度为64的S_5任务准确率从100%降至20%。

意义与局限

RLT展示了一种不同于单纯堆叠层数的扩展思路:把网络深度的一部分转化为沿序列展开的递归时间。它尤其适合需要持续维护离散或结构化状态的任务,也说明“更强的长度泛化”可能依赖计算路径是否能够随输入推进而增长。

不过,当前证据主要来自算法任务,不能直接等同于通用语言建模能力。分块更新带来的并行收益与状态精度损失,也表明未来系统需要根据任务类型动态选择反馈频率。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章