Recurrent Looped Transformer

Hacker News Top 论文

摘要

Recurrent Looped Transformer (RLT) 是一种新颖的架构,它结合了因果编码器和循环解码器,以实现具有无界时间深度的潜在推理、模型-硬件协同设计以及模型-强化学习算法协同设计。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/13 02:33

# 循环回路Transformer 来源:https://yifanzhang-pro.github.io/recurrent-looped-tranformer/ ## 摘要 **循环回路Transformer(RLT)** 将因果编码器与循环解码器相结合,该解码器在每个提示词和响应词之间传递其最终隐藏状态,并保持逐层滑动窗口注意力缓存。编码器构建全局键值记忆;解码器随着序列增长扩展连续潜在计算。 该设计融合了**具有无限时间深度的潜在推理**、**模型-硬件协同设计**以及**模型-强化学习算法协同设计**。并行编码器工作、序列批处理、记忆复用与检查点机制围绕循环核心构建。预训练、监督微调、采样与当前策略重放共享同一完整状态转换。 无限深度指的是可扩展的时间路径,而非单个标记内的无限计算。实际的推理增益、硬件效率以及强化学习扩展性仍有待验证。 ## 三大设计原则 01 / 推理### 随序列增长的深度 每个标记通过完整的解码器扩展循环路径。经过 \(t\) 个标记后,该路径遍历 \(tL_D\) 个解码器块,而每个标记的块数保持固定。 02 / 硬件### 围绕循环核心的并行计算 批量处理已知标记的编码器工作与独立的解码器更新。复用权重和记忆,同时通过检查点保存激活值以维持参考计算。 03 / 强化学习### 从采样到重放的统一转换 在当前参数下重建完整历史,包括提示状态与解码器滑动窗口注意力键值缓存。保持记录的行为概率与实际采样器绑定。 ### 完整状态至关重要 **因果编码器**:已知标记并行化 · 全局键值记忆 **循环解码器**:编码器交叉注意力 · 局部解码器滑动窗口注意力 **传递内容:循环输出 + 解码器滑动窗口键值缓存** 前一个输出进入下一次合并。每个滑动窗口注意力层读取其自身的近期键值。 提示与响应共享同一状态转换。编码器记忆受前缀限制;解码器注意力遵循其局部窗口。在服务边界处,解码器状态的两个组件均不重置。\[H_t=(s_t,C_t^D),\qquad H_0=(s_\star,\varnothing)\.\] \[(s_t,C_t^D)=D_\phi\!\left(\operatorname{Merge}(e_t,s_{t-1});M_{\le t},C_{t-1}^D,t\right)\.\] \[p_\Theta(x_{t+1}\mid x_{1:t})=\operatorname{softmax}\!\left(W_o\operatorname{RMSNorm}_o(s_t)\right)_{x_{t+1}}\.\] 其中 \(M_{\le t}\) 是全局编码器记忆,\(s_t\) 是循环输出,\(C_t^D\) 包含逐层解码器键值缓存。大小为 \(W\) 的滑动窗口注意力包含当前标记并最多保留 \(W-1\) 个历史条目供下次更新使用。 具体配置采用**48层编码器与48层解码器**,各阶段共享兼容的注意力与前馈网络权重。时间路径在 \(t\) 个标记后遍历 \(48t\) 个解码器块。每个标记执行96个逻辑块;由于解码器交叉注意力的存在,这些块的浮点运算量并不均等。 ## 训练与推理的统一执行 已知标记可通过因果批量进行编码。解码器更新仍按标记顺序进行,同时构建循环输出与解码器滑动窗口注意力缓存。 参考执行计划表: | 模式 | 编码器 | 解码器 | |------|--------|--------| | 提示填充 | 因果批量 | 通过每个提示标记更新完整状态 | | 生成 | 增量处理 | 从前一状态采样,每个标记仅消耗一次 | | 预训练 | 因果批量 | 在所有有效下一个标记目标上执行完全反向传播时间展开 | | 监督微调 | 因果批量 | 助手目标损失;所有上下文标记更新可微状态 | | 强化学习重放 | 使用当前权重重建 | 重放完整历史与滑动窗口注意力缓存;在消耗标记前对每个动作评分 | **前向一致性与完整梯度是独立的要求。**完全反向传播时间展开包含通过循环输出、解码器键值缓存与编码器记忆的路径。分离其中任何路径都会改变梯度。参数更新会使旧缓存失效,无法用于精确的当前策略重放。 行为对数概率必须描述实际的采样分布。精确重要性采样还需要覆盖支持范围。统一转换消除了结构性的提示边界不匹配;数值核对等价性与离策略估计仍是独立议题。 关于执行层面的区分,请参阅填充-解码核不匹配说明(https://github.com/yifanzhang-pro/Pretraining-RL-Science/blob/master/Prefill_Decode_Kernel_Mismatch.pdf)。 阅读完整报告 ↗ (https://yifanzhang-pro.github.io/recurrent-looped-tranformer/Recurrent_Looped_Transformer.pdf) 阅读中文论文 ↗ (https://yifanzhang-pro.github.io/recurrent-looped-tranformer/Recurrent_Looped_Transformer_ZH.pdf) ## 引用 如果您觉得本研究有用,请引用: ``` @techreport{zhang2026recurrentlooped, title = {Recurrent Looped Transformer}, author = {Zhang, Yifan}, year = {2026}, month = sep, url = {https://github.com/yifanzhang-pro/recurrent-looped-tranformer} } ```

相似文章

@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……

X AI KOLs Timeline

一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。

什么是 Looped Transformers?清晰解释(8分钟阅读)

TLDR AI

Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。