SNLP: 基于结构化牛顿校正的层并行推理

Hugging Face Daily Papers 论文

摘要

本文介绍了SNLP,这是一个通过用结构化近似替代精确牛顿校正来实现Transformer层并行推理的框架,在0.5B模型上实现了高达2.3倍的加速,同时降低了困惑度。

自回归语言模型顺序执行Transformer层,造成了传统的张量或流水线并行无法消除的延迟瓶颈。我们研究是否可以通过将跨层的隐藏状态迹视为非线性残差方程的解,并用并行牛顿式更新来求解,从而松弛这种逐层依赖性。虽然这一观点在原理上是合理的,但精确的牛顿校正需要昂贵的雅可比-向量积,且朴素的定点迭代在已训练的Transformer上不稳定。我们提出了结构化牛顿层并行(SNLP),一个训练和推理框架,用廉价的结构诱导替代动力学替换精确的层雅可比。在残差Transformer中,这产生了恒等牛顿(IDN),其中校正简化为前缀和式更新;在mHC风格的架构中,HC牛顿(HCN)使用模型的残差混合矩阵。我们进一步引入了SNLP感知正则化,训练模型使得一次或几次结构化牛顿迭代能准确近似顺序前向传播。在nanochat规模的Transformer上的实验表明,SNLP正则化提高了层并行兼容性,也能改善标准顺序困惑度,将基线PPL降低4.7%-23.4%。在推理时,SNLP结合层融合和分块分解实现了实际的墙钟加速:在0.5B Nanochat模型上,它达到2.3倍加速,同时仍将PPL改善了6.1%。这些结果表明,层并行推理不仅是对顺序执行的数值近似,而且可以作为一种有用的求解器诱导推理偏置。我们还指出了局限性:现成的预训练模型不太适应此过程,且精确收敛会恢复顺序计算,而不是提供单调的推理时间缩放。
查看原文
查看缓存全文

缓存时间: 2026/05/19 02:29

论文页面 - SNLP:通过结构化牛顿修正的层并行推理

来源:https://huggingface.co/papers/2605.17842

摘要

Transformer 模型可通过并行的牛顿风格更新实现更快的推理,这些更新利用结构化雅可比近似(structured Jacobian approximations)和专门的正则化技术来逼近顺序计算。

自回归语言模型(https://huggingface.co/papers?q=Autoregressive%20language%20models)逐层执行 Transformer 层(https://huggingface.co/papers?q=Transformer%20layers),形成了传统的张量或流水线并行(https://huggingface.co/papers?q=pipeline%20parallelism)无法消除的延迟瓶颈。我们研究能否通过将跨层的隐藏状态轨迹视为非线性残差方程(https://huggingface.co/papers?q=nonlinear%20residual%20equation)的解,并用并行的牛顿风格更新(https://huggingface.co/papers?q=Newton-style%20updates)来求解,从而放松这种层间依赖。尽管这种观点是合理的,但精确的牛顿修正需要昂贵的雅可比向量积(https://huggingface.co/papers?q=Jacobian-vector%20products),而在训练好的 Transformer 上,原始的不动点迭代(https://huggingface.co/papers?q=fixed-point%20iterations)是不稳定的。我们引入了结构化牛顿层并行(Structured Newton Layer Parallelism, SNLP)(https://huggingface.co/papers?q=Structured%20Newton%20Layer%20Parallelism),这是一个训练与推理框架,用廉价的、由架构引起的代理动力学来替代精确的层雅可比。在残差 Transformer(https://huggingface.co/papers?q=residual%20Transformers)中,这产生了恒等牛顿(Identity Newton, IDN)(https://huggingface.co/papers?q=Identity%20Newton),其修正简化为一种类前缀和的更新;在 mHC 风格架构(https://huggingface.co/papers?q=mHC-style%20architectures)中,HC 牛顿(HC Newton, HCN)(https://huggingface.co/papers?q=HC%20Newton)使用了模型的残差混合矩阵。我们进一步引入了感知 SNLP 的正则化,它训练模型使得一次或少数几次结构化牛顿迭代能够精确近似顺序前向传播。在 nanochat 规模 Transformer 上的实验表明,SNLP 正则化提高了层并行兼容性,同时也能改善标准顺序困惑度(https://huggingface.co/papers?q=perplexity),将基线 PPL 降低了 4.7%–23.4%。在推理时,SNLP 结合层融合(https://huggingface.co/papers?q=layer%20fusion)和分块分解(https://huggingface.co/papers?q=chunkwise%20decomposition)实现了实际的墙钟加速(https://huggingface.co/papers?q=wall-clock%20speedups):在 0.5B Nanochat 模型上,它达到了 2.3 倍加速,同时 PPL 仍改善了 6.1%。这些结果表明,层并行推理不仅仅是对顺序执行(https://huggingface.co/papers?q=sequential%20execution)的数值近似,还可以作为一种有用的、由求解器引发的推理偏差(https://huggingface.co/papers?q=inference%20bias)。我们也指出了局限性:现成的预训练模型不太适用于这一过程,并且精确收敛恢复的是顺序计算,而不是提供单调的推理时缩放。

查看 arXiv 页面(https://arxiv.org/abs/2605.17842)查看 PDF(https://arxiv.org/pdf/2605.17842)GitHub1(https://github.com/phymhan/nanochat-snlp)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17842)

在你的 agent 中获取这篇论文:

hf papers read 2605.17842

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.17842,即可从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.17842,即可从此页面链接。

引用此论文的 Spaces0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.17842,即可从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,即可从此页面链接。

相似文章

跳层还是循环?学习LLM中的Program-of-Layers

Hugging Face Daily Papers

本文介绍了PoLar,一个学习针对冻结transformer层的输入特定执行程序的框架,允许层被跳过、保留或重复。与固定深度方法相比,它提高了准确性并减少了推理开销。