Recurrent Looped Transformer
摘要
Recurrent Looped Transformer (RLT) 是一种新颖的架构,它结合了因果编码器和循环解码器,以实现具有无界时间深度的潜在推理、模型-硬件协同设计以及模型-强化学习算法协同设计。
暂无内容
查看缓存全文
缓存时间: 2026/09/13 02:33
# 循环回路Transformer
来源:https://yifanzhang-pro.github.io/recurrent-looped-tranformer/
## 摘要
**循环回路Transformer(RLT)** 将因果编码器与循环解码器相结合,该解码器在每个提示词和响应词之间传递其最终隐藏状态,并保持逐层滑动窗口注意力缓存。编码器构建全局键值记忆;解码器随着序列增长扩展连续潜在计算。
该设计融合了**具有无限时间深度的潜在推理**、**模型-硬件协同设计**以及**模型-强化学习算法协同设计**。并行编码器工作、序列批处理、记忆复用与检查点机制围绕循环核心构建。预训练、监督微调、采样与当前策略重放共享同一完整状态转换。
无限深度指的是可扩展的时间路径,而非单个标记内的无限计算。实际的推理增益、硬件效率以及强化学习扩展性仍有待验证。
## 三大设计原则
01 / 推理### 随序列增长的深度
每个标记通过完整的解码器扩展循环路径。经过 \(t\) 个标记后,该路径遍历 \(tL_D\) 个解码器块,而每个标记的块数保持固定。
02 / 硬件### 围绕循环核心的并行计算
批量处理已知标记的编码器工作与独立的解码器更新。复用权重和记忆,同时通过检查点保存激活值以维持参考计算。
03 / 强化学习### 从采样到重放的统一转换
在当前参数下重建完整历史,包括提示状态与解码器滑动窗口注意力键值缓存。保持记录的行为概率与实际采样器绑定。
### 完整状态至关重要
**因果编码器**:已知标记并行化 · 全局键值记忆
**循环解码器**:编码器交叉注意力 · 局部解码器滑动窗口注意力
**传递内容:循环输出 + 解码器滑动窗口键值缓存**
前一个输出进入下一次合并。每个滑动窗口注意力层读取其自身的近期键值。
提示与响应共享同一状态转换。编码器记忆受前缀限制;解码器注意力遵循其局部窗口。在服务边界处,解码器状态的两个组件均不重置。\[H_t=(s_t,C_t^D),\qquad H_0=(s_\star,\varnothing)\.\]
\[(s_t,C_t^D)=D_\phi\!\left(\operatorname{Merge}(e_t,s_{t-1});M_{\le t},C_{t-1}^D,t\right)\.\]
\[p_\Theta(x_{t+1}\mid x_{1:t})=\operatorname{softmax}\!\left(W_o\operatorname{RMSNorm}_o(s_t)\right)_{x_{t+1}}\.\]
其中 \(M_{\le t}\) 是全局编码器记忆,\(s_t\) 是循环输出,\(C_t^D\) 包含逐层解码器键值缓存。大小为 \(W\) 的滑动窗口注意力包含当前标记并最多保留 \(W-1\) 个历史条目供下次更新使用。
具体配置采用**48层编码器与48层解码器**,各阶段共享兼容的注意力与前馈网络权重。时间路径在 \(t\) 个标记后遍历 \(48t\) 个解码器块。每个标记执行96个逻辑块;由于解码器交叉注意力的存在,这些块的浮点运算量并不均等。
## 训练与推理的统一执行
已知标记可通过因果批量进行编码。解码器更新仍按标记顺序进行,同时构建循环输出与解码器滑动窗口注意力缓存。
参考执行计划表:
| 模式 | 编码器 | 解码器 |
|------|--------|--------|
| 提示填充 | 因果批量 | 通过每个提示标记更新完整状态 |
| 生成 | 增量处理 | 从前一状态采样,每个标记仅消耗一次 |
| 预训练 | 因果批量 | 在所有有效下一个标记目标上执行完全反向传播时间展开 |
| 监督微调 | 因果批量 | 助手目标损失;所有上下文标记更新可微状态 |
| 强化学习重放 | 使用当前权重重建 | 重放完整历史与滑动窗口注意力缓存;在消耗标记前对每个动作评分 |
**前向一致性与完整梯度是独立的要求。**完全反向传播时间展开包含通过循环输出、解码器键值缓存与编码器记忆的路径。分离其中任何路径都会改变梯度。参数更新会使旧缓存失效,无法用于精确的当前策略重放。
行为对数概率必须描述实际的采样分布。精确重要性采样还需要覆盖支持范围。统一转换消除了结构性的提示边界不匹配;数值核对等价性与离策略估计仍是独立议题。
关于执行层面的区分,请参阅填充-解码核不匹配说明(https://github.com/yifanzhang-pro/Pretraining-RL-Science/blob/master/Prefill_Decode_Kernel_Mismatch.pdf)。
阅读完整报告 ↗ (https://yifanzhang-pro.github.io/recurrent-looped-tranformer/Recurrent_Looped_Transformer.pdf)
阅读中文论文 ↗ (https://yifanzhang-pro.github.io/recurrent-looped-tranformer/Recurrent_Looped_Transformer_ZH.pdf)
## 引用
如果您觉得本研究有用,请引用:
```
@techreport{zhang2026recurrentlooped,
title = {Recurrent Looped Transformer},
author = {Zhang, Yifan},
year = {2026},
month = sep,
url = {https://github.com/yifanzhang-pro/recurrent-looped-tranformer}
}
```
相似文章
内存高效型循环Transformer:循环语言模型中的计算与内存解耦
提出内存高效型循环Transformer(MELT),这是一种新型循环大语言模型架构,通过跨循环共享单一KV缓存,并结合插值过渡与注意力对齐蒸馏的分块训练方法,实现了推理深度与内存消耗的解耦。
@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……
一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。
@yingfan_bot: 关于Looped Transformers的新论文!隐式推理速度快,但在大规模下难以达到CoT级别的准确性。能否lo…
一篇关于Looped Transformers的新论文发现,循环填充骨干网络为隐式推理提供了并行工作空间,使其能够像显式思维链(CoT)一样进行监督,并同时实现了速度和准确性。
@YouJiacheng:简而言之:YOCO 以 RNN 为解码器(且 RNN 通过 SWA 增强)。
介绍了 Recurrent Looped Transformer(RLT),一种具有无限推理深度的新型 AI 架构,在实现安全超级智能的背景下进行讨论。
什么是 Looped Transformers?清晰解释(8分钟阅读)
Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。