大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展
摘要
本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。
arXiv:2607.08186v1 Announce Type: new
摘要:扩展大型语言模型(LLM)主要通过增大Transformer骨干来实现,但对于已经强大的模型,这需要另一轮昂贵的预训练。我们研究是否可以通过在保留Transformer骨干不变的情况下,为每个令牌分配更多计算来持续改进现有骨干。深度循环(循环)Transformer追求这一目标,但难以扩展,因为循环计算与训练最大模型所使用的流水线并行不自然兼容。我们沿着序列长度维度增加计算,额外的计算只是更长的输入,并保持与标准大型模型训练的兼容性。我们提出Hidden Decoding,这是一种在持续预训练(CPT)期间应用的序列长度扩展方法。它将每个令牌扩展为具有独立嵌入表的n个流,并将中间流的键值缓存作为上下文保留,因此每个令牌可以在不添加或加宽Transformer层的情况下执行更多内部计算。为了在大规模下保持可负担性,我们引入了Stream-Factorized Attention,其中大多数层仅在每个流内进行注意力,只有少数层跨流混合,将注意力成本从n的二次方降低到近似线性。实验支持两个扩展结果。在前沿规模上,我们在n=4时训练了WeLM-HD4-80B和WeLM-HD4-617B,并改进了它们匹配的非HD基线,使Hidden Decoding成为首个在100B+ MoE规模上得到验证的序列长度扩展方法。在各种扩展因子下,增益随着n的增加而增长,表明序列长度扩展是面向前沿规模LLM的实用固定骨干扩展路径。
查看缓存全文
缓存时间: 2026/07/10 06:13
# 大规模隐式解码:面向大型语言模型的潜在计算扩展
来源:https://arxiv.org/html/2607.08186
###### 摘要
大型语言模型 (LLM) 的扩展主要通过扩大Transformer主干来实现,但对于已经强大的模型,这需要新一轮代价高昂的预训练。本文研究在固定Transformer主干的前提下,是否可以通过为每个词元分配更多计算量来持续改进现有主干。深度循环(循环)Transformer旨在追求这一目标,但难以扩展,因为循环计算与用于训练最大模型的流水线并行不兼容。我们沿序列长度维度增加计算,其中额外计算仅表现为更长的输入,且与标准大模型训练兼容。我们提出**隐式解码 (Hidden Decoding)**,这是一种在持续预训练 (CPT) 中应用的序列长度扩展方法。它将每个词元扩展为 \(n\) 个**流**,每个流拥有独立的嵌入表,并保留中间流的键值缓存作为上下文。这样,每个词元执行更多的内部计算,而无需增加或加宽Transformer层。为了在大规模下保持计算可行性,我们引入**流分解注意力**,在该机制中,大多数层仅在每个流内部进行注意力计算,只有少数层在流之间进行混合,从而将注意力成本从 \(O(n^2 L^2)\) 降低到近似线性于 \(n\)。实验为两个扩展结论提供了支持。在前沿规模上,我们以 \(n=4\) 训练了 WeLM-HD4-80B 和 WeLM-HD4-617B,并改进了其匹配的非HD基线,使隐式解码成为首个在 100B+ MoE 规模上得到验证的序列长度扩展方法。在各种扩展因子下,性能提升随着 \(n\) 的增加而增长,这表明序列长度扩展是面向前沿规模LLM的一种实用的固定主干扩展路径。
参考图例 图 1:隐式解码能够扩展并改进前沿模型。(a) 在密集型 Qwen3-8B-Base 上,平均准确率随扩展因子 \(n\) 稳步增长。(b) WeLM-HD4-80B 和 WeLM-HD4-617B 在相同的早期仅SFT后训练后,与匹配的非HD对应模型 WeLM-80B 和 WeLM-617B 相比的性能提升 \(\Delta\)(以百分点计)。
## 1 引言
扩展一直是大型语言模型 (LLM) 取得进步的主要来源。增加模型规模、训练数据和训练计算持续带来更强的模型 [kaplan2020scaling, hoffmann2022training]。然而,对于已经很强的基础模型,进一步扩展Transformer主干代价高昂:通常需要另一轮大规模预训练,并增加训练和服务成本。这激发了本文的研究背景:通过为每个词元提供更多内部计算来改进现有主干,同时保持Transformer主干固定。
最近的推理模型和测试时扩展研究表明,即使参数固定,为每个问题分配更多计算也能提高准确率 [openai2024reasoning, deepseek2025r1, muennighoff2025s1, snell2024scaling]。这推动了一个近期潜在推理工作开始追求的目标:将部分额外的思考计算从可见词元转移到模型内部计算中。
实现这一目标的一个主要方向是循环深度或循环Transformer,它通过在每个词元上多次重复使用相同的Transformer模块来增加计算 [geiping2025latent_recurrent, zhu2025ouro, saunshi2025reasoninglatentthoughtspower, park2026loopus]。这是一种使用固定Transformer权重直接增加每个词元计算量的方式。然而,它难以扩展。训练最大的MoE模型依赖于流水线并行 [huang2019gpipe, narayanan2021efficient, deepseekai2025deepseekv3technicalreport, kimiteam2026kimik2openagentic],这假设每个输入仅通过模型各阶段一次。循环模型打破了这一假设,因为它会在每次迭代中将相同的隐藏状态反馈回相同的阶段,这会阻塞流水线并使GPU空闲。与此一致,循环模型一直停留在较小规模:最大的是 40B 密集型 LoopCoder,它是在没有流水线并行的情况下训练的 [yang2026iquestcoderv1technicalreport],而其他循环语言模型仍然只有几十亿参数 [geiping2025latent_recurrent, zhu2025ouro]。因此,循环仍然缺乏一种实用的方式来扩展到非常大的模型,同时保持GPU高效利用。
一个关键的观察是,序列维度计算比深度复用更适合大规模训练。沿序列维度,扩展仅仅相当于提供更长的输入,这自然与标准的大模型训练优化兼容。其通用范式是将每个输入词元沿序列扩展为多个流,在单次前向传播中处理扩展后的序列,并将下一个词元的损失仅应用于最后一个流,这样中间流增加了每个词元的计算量,而无需添加新的Transformer层或扩展现有层。一个实例是并行隐式解码Transformer (PHD) [wu2025efficientpretraininglengthscaling],它重复每个词元,但为了降低推理成本,使重复词元的KV是瞬态的:中间流可以在当前词元内提供帮助,但它们不会作为独立的KV上下文保留给后续词元。因此,能力扩展设置需要持续存在的中间流状态,这些状态在CPT期间跨位置保持可用。
在这项工作中,我们提出一种名为**隐式解码**的序列长度扩展方法,通过持续预训练 (CPT) 来提升前沿规模LLM的能力。两个设计选择使扩展后的流对能力扩展有用。为了给不同流赋予不同的初始状态,我们将词表嵌入表复制为 \(n\) 个**每个流独立**的表,将每个词元 \(x_i\) 扩展为流 \((E_1(x_i), E_2(x_i), \ldots, E_n(x_i))\);通过CPT,这些表学习到相同词元的不同初始表示。为了让中间计算跨位置持续存在,我们保留了中间流的KV,使得流之间积累的计算作为上下文对后续词元保持可用。
保留所有流的KV使得中间计算对后续词元可用,但也使得注意力成本增长为 \(O(n^2 L^2)\),训练具有长序列的大型模型变得不可行。因此,我们引入**流分解注意力**。关键思想是将跨流注意力限制在一部分层中:大多数层仅在每个流内部进行注意力计算,流之间仅在其余层交换信息,这些层遵循基础模型的注意力模式(滑动窗口,或当基础模型使用全局注意力时)。由于避免了在大多数层上对完整的 \(nL\) 序列进行密集注意力,增加的注意力成本保持近似线性而非二次于 \(n\)。这种效率使得隐式解码能够在超过1000亿参数的MoE模型规模上实际训练,这是先前的循环或长度扩展方法未能达到的领域。
实验直接验证了这两个扩展主张。为了测试隐式解码是否能扩展到100B+ MoE领域,我们以 \(n=4\) 训练了 WeLM-HD4-80B 和 WeLM-HD4-617B。WeLM-HD4-80B 在所有九个共享基准测试上均优于 WeLM-80B,在 SciCode (45.8→50.0) 和 PHYBench (69.8→73.8) 上取得了显著提升。WeLM-HD4-617B 也在所有九个共享基准测试上优于 WeLM-617B,包括 GPQA Diamond (89.1→91.2)、HLE (33.6→35.4) 和 FrontierMath (49.0→51.0)。这些结果采用了早期仅SFT后训练方案:每对匹配的非HD和HD模型使用相同的SFT训练方案,具有短期的监督微调计划且无强化学习。我们使用它们进行受控比较;成熟的 WeLM 发布分数不在本文讨论范围内。为了测试扩展因子本身是否提供扩展,我们在 80B 渐进扩展研究中将 \(n\) 从 2 增加到 8。MMLU 单调提升 (85.0→86.7→87.5),Pile-test BPB 从 0.386 下降到 0.378。这些结果共同确立了序列长度扩展作为前沿规模LLM的一种实用的固定主干扩展路径。
**主要贡献**
* **前沿规模固定主干扩展**。据我们所知,我们首次展示了通过持续预训练 (CPT) 在 100B+ MoE 规模上进行序列长度扩展。这产生了两个关键模型 WeLM-HD4-80B 和 WeLM-HD4-617B,达到了先前的深度循环或长度扩展方法未能达到的领域。
* **高效的序列长度扩展**。为了使扩展后的序列在前沿规模上可训练,我们引入了**流分解注意力**:大多数层仅在每个流内部进行注意力计算,而一小部分混合流。这将注意力成本保持为近似线性于 \(n\);在 WeLM-HD4-80B 和 WeLM-HD4-617B 上,4 倍扩展序列的每批次成本分别仅为 5.1 倍和 4.4 倍,远低于密集注意力的 16 倍基线。
* **扩展因子缩放**。我们展示了增加扩展因子可以改善语言建模损失和下游准确率,验证了 \(n\) 作为固定Transformer主干的一个实用缩放旋钮。
## 2 方法
**隐式解码**是一种序列长度扩展方法,它增加每个词元接收的计算量,而无需扩大Transformer主干。每个输入词元在Transformer内部用 \(n\) 个并行**流**表示,因此长度为 \(L\) 的序列在一次前向传播中被处理成长度为 \(nL\) 的序列,在预测之前为每个词元提供 \(n\) 步内部计算。图 2 对比了隐式解码与深度循环(循环)计算:隐式解码将额外计算沿序列维度放置,而循环计算沿深度维度重复使用主干。本节形式化多流扩展和训练目标(§2.1),介绍**流分解注意力**以在规模上保持扩展的可行性(§2.2),并描述如何从收敛的检查点逐步增加扩展因子(§2.3)。
#### 设置与符号。
标准Transformer语言模型通过单个词表嵌入表 \(E\) 将每个词元 \(x_i\) 映射,形成输入序列 \((E(x_1), \dots, E(x_L))\);添加旋转位置编码 (RoPE) [su2024roformer] 的位置,应用因果注意力,并通过共享头 \(g_\theta(\cdot)\) 从每个位置的隐藏状态预测下一个词元。隐式解码保持此路径不变,仅改变每个词元嵌入到序列中的方式。
参考图例 图 2:循环潜在计算 vs. 隐式解码。(a) 深度循环(循环)计算在每个词元的隐藏状态上重复使用相同的骨干 \(f_\theta\) 进行 \(K\) 步,然后预测下一个词元。(b) 隐式解码将每个词元扩展为 \(n\) 个流,使用独立的嵌入表 \(E_1, \dots, E_n\),将它们交错成一个长度为 \(nL\) 的序列,该序列通过相同的主干进行一次前向传播。下一个词元的交叉熵损失仅应用于最终流位置 (\(E_n/h_n\));较早的流 (\(E_1, \dots, E_{n-1}\)) 不接收损失,作为潜在计算状态。该面板显示了一个双流示例。
### 2.1 多流词元扩展
隐式解码的核心构造是用 \(n\) 个独立的嵌入表(我们称之为**流**)替换标准模型的单个嵌入表,并将其输出交错成一个更长的输入序列。
#### 扩展后的序列。
给定一个输入序列 \(X=(x_1, \dots, x_L)\) 和 \(n\) 个嵌入表 \(E_1, \dots, E_n\),我们通过将词元 \(x_i\) 的流 \(k\) 表示放置在物理位置 \(t = (i-1)n + k\) 来形成一个长度为 \(nL\) 的扩展序列 \(S\):
\[ S_t = E_k(x_i), \qquad 1 \leq i \leq L,\quad 1 \leq k \leq n. \tag{1} \]
对于 \(n=2\),这产生 \(S = \big(E_1(x_1), E_2(x_1), E_1(x_2), E_2(x_2), \dots\big)\)。扩展后的序列被送入相同的Transformer,在标准因果注意力下处理,使用连续的RoPE位置 \(0, 1, \dots, nL-1\)。扩展因子 \(n\) 直接控制添加的额外每个词元计算量。
#### 训练目标。
只有每个词元的最后一个流 \(E_n(x_i)\) 受到监督:从其隐藏状态通过共享的语言建模头 \(g_\theta\) 预测下一个词元 \(x_{i+1}\),而前 \(n-1\) 个流不接收直接损失。令 \(h_t\) 表示物理位置 \(t\) 处的隐藏状态,目标是在最终流位置 \(t=in\) 处应用的下一个词元交叉熵损失:
\[ \mathcal{L}(\theta) = -\sum_{i=1}^{L} \log g_\theta\!\big(x_{i+1} \mid h_{in}\big). \tag{2} \]
由于注意力是因果的,最后一个流 \(E_n(x_i)\) 可以关注到相同词元和所有先前词元的更早流。因此,前 \(n-1\) 个流充当中间计算状态,在最终的、携带预测的流之前逐步优化表示。仅监督最后一个流,并为每个流提供其自己的嵌入表,赋予了中间流这种潜在计算角色;监督所有流,或在预测前对它们的输出求和,会在 §5.1 的监督设计消融实验中降低性能。
### 2.2 流分解注意力
在 \(nL\) 个扩展位置上运行密集注意力会花费 \(O(n^2 L^2)\) 成本,因此对于具有长序列的大型LLM来说,训练成本急剧增加。**流分解注意力**通过使大多数层仅在**流内部**进行注意力计算,并将**跨流**混合限制在一部分层中,来降低这种成本。
#### 流和词元索引。
对于扩展序列中的位置 \(t \in \{1, \dots, nL\}\),设其词元索引和流索引为:
\[ i(t) = \lceil t/n \rceil, \qquad s(t) = \big((t-1) \bmod n\big) + 1, \tag{3} \]
因此 \(S_t = E_{s(t)}(x_{i(t)})\)。连续的 \(n\) 个位置块对应于连续的词元,\(n\) 个流在每个块内按顺序排列。
#### 流内与跨流层。
使用等式 (3) 中的索引,一个**流内**层将注意力限制在较早的相同流位置:
\[ M^{\text{intra}}_{t,t'} = \mathbf{1}\!\left[\, t' \leq t \ \wedge \ s(t') = s(t) \,\right], \tag{4} \]
其成本为 \(O(nL^2)\),而非密集层的 \(O(n^2 L^2)\);一个**跨流**层也关注其他流,遵循模型通常的注意力模式。图 3 说明了由此产生的三种掩码类型。
#### 设计。
大多数层是流内层,跨流注意力仅在一部分层中启用。我们为此不添加任何新的注意力层:我们复用基础模型自身的注意力层作为跨流相似文章
降低LLM延迟
用于降低大语言模型延迟、提高推理速度的技术和方法。
水平扩展LLM:无需权重修改的隐藏状态耦合 [R]
残差耦合(RC)使用轻量级学习线性桥接器并行连接冻结的语言模型,实现无需权重修改的水平扩展。与MoE相比,它最多可将困惑度降低80.7%,并在TruthfulQA上提升9.1个百分点的准确率。
超越单维压缩:大语言模型的复合稀疏前沿
本文提出了一种针对LLM的复合稀疏框架,结合了静态参数剪枝与动态令牌级计算,表明混合这两种机制优于单维压缩,并能延迟性能退化。
基于时空并行解码与置信度外推的高效扩散LLMs
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。
基于自监督早期退出机制加速大语言模型推理
本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。