标签
The paper proposes Source-Centered State Evolution (SCSE), a method for looped Transformers that reconciles input conditioning with reference-preserving shared recurrence, improving recurrent quality frontiers across multiple benchmarks.
Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。
本文研究了权重共享的循环Transformer何时实现真正的算法,引入了预算定律,并展示了机制在不同训练预算间的可迁移性,对自适应计算和可解释性具有意义。
本文通过将轨迹形成与退出读出分离,研究循环Transformer中的自适应深度,表明固定先验深度监督通常优于联合训练的门控,而自适应计算性能差更多源于诱导的轨迹而非门控表达能力。
DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。
一篇关于Looped Transformers的新论文发现,循环填充骨干网络为隐式推理提供了并行工作空间,使其能够像显式思维链(CoT)一样进行监督,并同时实现了速度和准确性。
本文介绍了一种神经符号方法G-RRM,它使用递归推理模型来引导符号求解器解决约束满足问题,在特定条件下显示出显著的加速效果。
DiscoLoop 提出了一种循环架构,该架构同时携带离散嵌入通道和连续隐藏状态通道,用于改进 Transformer 在多跳推理中的表现,在合成任务上实现了近乎完美的准确率,在真实语言建模中表现更优。
本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。
本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。
Looped Transformers 的共同发明者 Angeliki Giannou 已成功通过博士论文答辩,并即将开始新的职位。Dimitris Papailiopoulos 在社交媒体上送上了祝贺。