Transformer可以同时持有两个想法:LLMs中线性叠加的证据

Hugging Face Daily Papers 论文

摘要

本文证明LLMs中的Transformer在合并输入时表现出线性叠加,支持叠加线性假设,并提出一种引导解码方法以分离叠加输出。

虽然大型语言模型(LLMs)依赖于高度非线性的组件,但在这项工作中,我们证明它们表现出基本线性:当来自不同文本流的输入线性组合时,模型会输出各个下一个token分布的叠加。我们将此称为叠加线性假设。我们提供证据表明,叠加是Transformer架构的内在属性,而非训练的涌现结果;事实上,我们观察到随着预训练的进行,叠加倾向于减弱。然而,我们证明通过轻量级微调可以显著恢复线性,大幅减少预测的下一个token分布与各个下一个token分布平均值之间的差异。最后,我们引入一种引导解码方法来分离叠加输出,使得单次前向传播能够同时生成两个连贯的续写内容。
查看原文
查看缓存全文

缓存时间: 2026/09/25 15:46

论文页面 - 你的Transformer如何同时容纳两个想法:大语言模型中线性叠加的证据

来源:https://huggingface.co/papers/2609.29845

摘要

尽管大语言模型(LLMs)高度依赖非线性组件,但本研究证明它们表现出根本的线性特性:当来自不同文本流的输入被线性组合时,模型的输出是各个独立下一个词元分布的叠加。我们将其称为叠加线性假说。我们提供的证据表明,叠加是Transformer架构的固有属性,而非训练过程中的涌现效应;事实上,我们观察到随着预训练的推进,这种特性倾向于减弱。然而,我们证明通过轻量级微调可以显著恢复线性,从而大幅降低预测的下一个词元分布与各个独立分布平均值之间的差异。最后,我们提出了一种引导解码流程,能够分离叠加的输出,使得单次前向传播即可同时生成两个连贯的续写内容。

查看 arXiv 页面 (https://arxiv.org/abs/2609.29845) 查看 PDF (https://arxiv.org/pdf/2609.29845) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.29845)

在你的代理中获取此论文:

hf papers read 2609.29845

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无模型链接此论文。

在模型 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文。

在数据集 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文。

在 Space README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接。

包含此论文的收藏 0

无收藏包含此论文。

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章