@askalphaxiv: 另一项关于循环Transformer的酷研究。他们提出一个问题:“我们能否直接在推理时循环一个冻结的、现成的检查点…
摘要
本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。
查看缓存全文
缓存时间: 2026/05/27 03:18
关于循环Transformer的另一项酷研究
他们提出了一个问题:“我们能否直接在推理时循环一个冻结的、现成的检查点而不做任何修改?”
因此,简单的重复会将隐藏状态推到后续层预期的分布之外,从而导致性能下降。
但如果你将 Transformer 层视为残差常微分方程中的欧拉步,并用阻尼龙格-库塔子步替代简单的循环,这是可能的。
这使得冻结模型在测试时获得额外的隐式计算,无需微调、无需新权重、无需架构变化。
最好的效果出现在像 MMLU-Pro、GPQA 和 ARC 这样的高难度知识多项选择题任务上。
相似文章
什么是 Looped Transformers?清晰解释(8分钟阅读)
Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。
DeepLoop:循环Transformer的深度缩放
DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。
@yingfan_bot: 关于Looped Transformers的新论文!隐式推理速度快,但在大规模下难以达到CoT级别的准确性。能否lo…
一篇关于Looped Transformers的新论文发现,循环填充骨干网络为隐式推理提供了并行工作空间,使其能够像显式思维链(CoT)一样进行监督,并同时实现了速度和准确性。
全循环Transformer:简单稳定循环
本文识别出梯度振荡和残差爆炸是循环Transformer训练不稳定的原因,并提出了全循环Transformer,包含两个无需参数调整的修改(全循环架构和注意力注入),能够稳定训练至12次循环迭代,在下游任务性能上实现了高达13.2%的提升。
@DorothyDDU: LoopCoder-v2 已发布 Loop Transformers 重复使用同一个块进行循环隐藏状态优化——让模型“思考”更多……
本文介绍了LoopCoder-v2,一个70亿参数的并行循环变换器系列,用于代码生成,并研究了最优循环次数,发现两个循环能带来显著提升,而更多循环则会导致性能下降。