SNLP: 基于结构化牛顿校正的层并行推理
摘要
本文介绍了SNLP,这是一个通过用结构化近似替代精确牛顿校正来实现Transformer层并行推理的框架,在0.5B模型上实现了高达2.3倍的加速,同时降低了困惑度。
查看缓存全文
缓存时间: 2026/05/19 02:29
论文页面 - SNLP:通过结构化牛顿修正的层并行推理
来源:https://huggingface.co/papers/2605.17842
摘要
Transformer 模型可通过并行的牛顿风格更新实现更快的推理,这些更新利用结构化雅可比近似(structured Jacobian approximations)和专门的正则化技术来逼近顺序计算。
自回归语言模型(https://huggingface.co/papers?q=Autoregressive%20language%20models)逐层执行 Transformer 层(https://huggingface.co/papers?q=Transformer%20layers),形成了传统的张量或流水线并行(https://huggingface.co/papers?q=pipeline%20parallelism)无法消除的延迟瓶颈。我们研究能否通过将跨层的隐藏状态轨迹视为非线性残差方程(https://huggingface.co/papers?q=nonlinear%20residual%20equation)的解,并用并行的牛顿风格更新(https://huggingface.co/papers?q=Newton-style%20updates)来求解,从而放松这种层间依赖。尽管这种观点是合理的,但精确的牛顿修正需要昂贵的雅可比向量积(https://huggingface.co/papers?q=Jacobian-vector%20products),而在训练好的 Transformer 上,原始的不动点迭代(https://huggingface.co/papers?q=fixed-point%20iterations)是不稳定的。我们引入了结构化牛顿层并行(Structured Newton Layer Parallelism, SNLP)(https://huggingface.co/papers?q=Structured%20Newton%20Layer%20Parallelism),这是一个训练与推理框架,用廉价的、由架构引起的代理动力学来替代精确的层雅可比。在残差 Transformer(https://huggingface.co/papers?q=residual%20Transformers)中,这产生了恒等牛顿(Identity Newton, IDN)(https://huggingface.co/papers?q=Identity%20Newton),其修正简化为一种类前缀和的更新;在 mHC 风格架构(https://huggingface.co/papers?q=mHC-style%20architectures)中,HC 牛顿(HC Newton, HCN)(https://huggingface.co/papers?q=HC%20Newton)使用了模型的残差混合矩阵。我们进一步引入了感知 SNLP 的正则化,它训练模型使得一次或少数几次结构化牛顿迭代能够精确近似顺序前向传播。在 nanochat 规模 Transformer 上的实验表明,SNLP 正则化提高了层并行兼容性,同时也能改善标准顺序困惑度(https://huggingface.co/papers?q=perplexity),将基线 PPL 降低了 4.7%–23.4%。在推理时,SNLP 结合层融合(https://huggingface.co/papers?q=layer%20fusion)和分块分解(https://huggingface.co/papers?q=chunkwise%20decomposition)实现了实际的墙钟加速(https://huggingface.co/papers?q=wall-clock%20speedups):在 0.5B Nanochat 模型上,它达到了 2.3 倍加速,同时 PPL 仍改善了 6.1%。这些结果表明,层并行推理不仅仅是对顺序执行(https://huggingface.co/papers?q=sequential%20execution)的数值近似,还可以作为一种有用的、由求解器引发的推理偏差(https://huggingface.co/papers?q=inference%20bias)。我们也指出了局限性:现成的预训练模型不太适用于这一过程,并且精确收敛恢复的是顺序计算,而不是提供单调的推理时缩放。
查看 arXiv 页面(https://arxiv.org/abs/2605.17842)查看 PDF(https://arxiv.org/pdf/2605.17842)GitHub1(https://github.com/phymhan/nanochat-snlp)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17842)
在你的 agent 中获取这篇论文:
hf papers read 2605.17842
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.17842,即可从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.17842,即可从此页面链接。
引用此论文的 Spaces0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.17842,即可从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,即可从此页面链接。
相似文章
@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。
跳层还是循环?学习LLM中的Program-of-Layers
本文介绍了PoLar,一个学习针对冻结transformer层的输入特定执行程序的框架,允许层被跳过、保留或重复。与固定深度方法相比,它提高了准确性并减少了推理开销。
@_avichawla: 英伟达研究人员构建了一种新的Transformer变体。对层结构做了一个小改动:- 解码速度提升1.7倍 - long-…
英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。
@yingfan_bot: 关于Looped Transformers的新论文!隐式推理速度快,但在大规模下难以达到CoT级别的准确性。能否lo…
一篇关于Looped Transformers的新论文发现,循环填充骨干网络为隐式推理提供了并行工作空间,使其能够像显式思维链(CoT)一样进行监督,并同时实现了速度和准确性。
即插即用脉冲算子:突破脉冲Transformer中的非线性瓶颈
本文提出一种即插即用框架,通过LIF神经元的种群计算和轻量级位移缩放,实现Transformer非线性(如Softmax、SiLU、归一化)的脉冲友好近似,在无需微调的LLMs上准确率下降不到1%。