Transformer可以同时持有两个想法:LLMs中线性叠加的证据
摘要
本文证明LLMs中的Transformer在合并输入时表现出线性叠加,支持叠加线性假设,并提出一种引导解码方法以分离叠加输出。
查看缓存全文
缓存时间: 2026/09/25 15:46
论文页面 - 你的Transformer如何同时容纳两个想法:大语言模型中线性叠加的证据
来源:https://huggingface.co/papers/2609.29845
摘要
尽管大语言模型(LLMs)高度依赖非线性组件,但本研究证明它们表现出根本的线性特性:当来自不同文本流的输入被线性组合时,模型的输出是各个独立下一个词元分布的叠加。我们将其称为叠加线性假说。我们提供的证据表明,叠加是Transformer架构的固有属性,而非训练过程中的涌现效应;事实上,我们观察到随着预训练的推进,这种特性倾向于减弱。然而,我们证明通过轻量级微调可以显著恢复线性,从而大幅降低预测的下一个词元分布与各个独立分布平均值之间的差异。最后,我们提出了一种引导解码流程,能够分离叠加的输出,使得单次前向传播即可同时生成两个连贯的续写内容。
查看 arXiv 页面 (https://arxiv.org/abs/2609.29845) 查看 PDF (https://arxiv.org/pdf/2609.29845) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.29845)
在你的代理中获取此论文:
hf papers read 2609.29845
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型链接此论文。
在模型 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文。
在数据集 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文。
在 Space README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接。
包含此论文的收藏 0
无收藏包含此论文。
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
大型语言模型是如何工作的(26分钟阅读)
详细讲解基于Transformer的大型语言模型的工作原理,涵盖分词、嵌入、注意力机制和下一个词元预测,无需复杂数学。
@v0xium: 我强烈推荐阅读Dan Jurafsky和James H. Martin的《Speech and Language Processing》中的Transformer章节…
推荐阅读Dan Jurafsky和James H. Martin的免费书籍《Speech and Language Processing》中的Transformer章节,这是理解LLM背后数学的最佳资源之一,并包含引用关于LLM预训练的解释。
@ickma2311: 高效AI 第12讲:Transformer 与 LLM 本讲不仅介绍 LLM 的工作原理,还深入讲解其底层构建模块……
一门高效AI课程的第12讲笔记,涵盖 Transformer 与 LLM 基础知识,包括多头注意力机制、位置编码、KV 缓存,以及模型架构与推理效率之间的关联。内容阐释了 Transformer 中的设计选择如何影响内存占用、延迟表现和硬件效率。
LLMs 如何存储如此多的知识?一探特征叠加机制
探讨了大语言模型如何利用特征叠加将海量知识压缩至有限空间,并用生物学类比解释了维度与特征的区别。
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。