返回文章列表
大语言模型

Loopie:让循环 Transformer 重新进入大模型效率竞赛

阅读约 2 分钟

导语

Transformer 的扩展路径通常很直接:更多参数、更多数据、更多计算。但这条路线成本高昂,也让另一类思路重新受到关注——能否让同一组参数被多次“循环”使用,从而用较小的激活规模换取更强的计算深度?论文《Loop the Loopies!》提出的 Loopie,正是围绕这一问题给出的新尝试。

核心要点

  • 模型形态:Loopie 是一个循环 Transformer 系列,采用 Mixture-of-Experts(MoE)结构。论文中包括两个版本:20B 总参数、2B 激活参数模型,以及 6B 总参数、0.6B 激活参数模型。
  • 要解决的问题:循环 Transformer 的历史痛点在于,当预训练计算增加 N 倍时,直接把模型参数扩大 N 倍,通常比让同一模型循环 N 次效果更好。也就是说,循环计算过去常常输给“堆参数”。
  • 作者的主张:论文称,Loopie 通过新的设计缓解了这一问题。在大量消融实验中,包括与一个常规 30B-A3B 模型对比,Loopie 在相同计算预算下显著优于普通 Transformer 基线。
  • 后训练能力:作者还提出了一套后训练流程,用于增强 Loopie 的推理能力。论文摘要称,在 2025 年 IMO 和 IPhO 上,Loopie 在不使用工具的情况下达到金牌表现。

意义与影响

Loopie 的看点不只是“又一个 MoE 大模型”,而是它把效率问题聚焦到参数复用与计算深度之间的权衡。MoE 已经证明可以在较低激活参数下扩大总容量,而循环 Transformer 进一步提出:同一套模块是否能通过多次迭代形成更强推理轨迹?如果作者的实验结论能够在更广泛基准和真实任务中复现,这可能为大模型扩展提供一条不同于单纯增参的路线。

当然,当前素材主要来自论文摘要和页面信息,仍需要阅读全文才能判断 Loopie 的具体结构改动、训练数据设置、评测协议以及 IMO/IPhO 结果的可比性。尤其是“同等计算预算”下的比较是否公平、后训练流程贡献有多大,都会影响外界对其实际价值的判断。

总体来看,Loopie 代表了一种值得关注的方向:在大模型成本持续上升的背景下,通过循环计算、专家稀疏激活和后训练推理增强,寻找更高的性能/计算比。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
DeepLoop:让循环 Transformer 的深度扩展更稳定
大语言模型
cctest.ai
大语言模型

DeepLoop:让循环 Transformer 的深度扩展更稳定

DeepLoop 关注一个容易被忽视的问题:当 Transformer 通过重复使用同一组模块来增加“展开深度”时,传统残差缩放规则不一定仍然适用。论文提出按参数被重复访问的方式重新设定缩放,从而提升循环式语言模型的训练稳定性与效果。

阅读全文
CCTest · Blog
GigaWorld-Policy-0.5:让世界动作模型更接近实时机器人控制
大语言模型
cctest.ai
大语言模型

GigaWorld-Policy-0.5:让世界动作模型更接近实时机器人控制

GigaWorld-Policy-0.5 试图解决世界动作模型在推理阶段“太重”的问题:训练时利用未来视觉动态,部署时只解码动作。其混合训练、专家化 Transformer 与 AutoResearch 搜索流程,共同指向更高效的机器人策略学习。

阅读全文