聚集而非接纳:注意力如何将潜在变量转化为可表达形式

Hugging Face Daily Papers 论文

摘要

本文探讨语言模型中的注意力机制如何无需选择性门控即可使潜在变量变得可访问,并识别出一个特定需求的中等深度窗口,注意力介导的聚集在此发生。

语言模型以一种可报告的形式持有潜在量,当任务要求灵活重用时,该形式中包含更多的量。什么使得表示进入该形式尚无定论,'工作空间'一词引出了接纳的故事:一个决定什么进入的门控。在开放权重模型上使用Jacobean lenses进行测试,在一个五个分支共享相同上下文的基准测试中,我们未发现预期的门控。需求提高了概念的透镜可见度,超出了对提供的值应用算子所产生的效果:在我们的主要检查点上,百分位排名增加了+0.050 [+0.045, +0.057],在我们测量的四个模型中均为正值,尽管该分支的答案已达到上限,并且在该读出下,准确度匹配的对比更强。同时,一个共享的线性映射从每个分支(包括控制分支)解码变量,其值为选择校正基线的6.4-9.0倍。在查询位置产生后续可读形式的是中等深度窗口内的注意力介导聚集:将补丁深度与读出深度分离,使得在非饱和读出下,该处的传输至少是任何更浅处的17倍,且没有测试的MLP输出在其中做出正贡献。在饱和百分位排名下,相同的网格未能定位该窗口,这是该度量的一个事实。一个不需要该变量的分支集中程度低七倍,因此该窗口是特定需求的。该窗口有两个测量边界,下方的存活失败和上方的破坏,并且在来自另一家族的64层混合模型和62层密集模型中,它位于相同的分数深度。我们定位变量被安装和读取的位置,而不是来自通道的路径,该路径不传输任何内容。但读出不是使用情况的校准度量:三个组件将其移动到彼此12%以内,并且它们对答案的影响相差7.4倍。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:53

论文页 - 聚集而非准入:注意力如何将潜在变量转化为可表述形式

来源:https://huggingface.co/papers/2608.15022

摘要

在语言模型中,灵活的复用需要在中等深度窗口进行注意力介导的聚集以使潜在变量可读,此过程无需选择性门控,且读出度量难以反映实际使用情况。

语言模型以可报告的形式保存潜在量,当任务要求灵活复用时,该形式中的量会增多。何种原因使表征进入该形式尚不明确,而词工作区(https://huggingface.co/papers?q=workspace)理论提出了一种准入假说:存在决定何物进入的门控。我们通过雅可比透镜(https://huggingface.co/papers?q=Jacobian%20lenses)在开源模型(https://huggingface.co/papers?q=open-weight%20models)上进行测试,并使用一个五个分支共享相同上下文的基准,未发现预期存在的门控机制。需求将概念的透镜可见性提升至超出对提供值施加算子的水平:在我们主要检查点上的百分位排名(https://huggingface.co/papers?q=percentile%20rank)提升+0.050 [+0.045, +0.057](在所有四个测量的检查点上均为正值),尽管该分支的回答已达到天花板效应,且准确率匹配对比在该读出(https://huggingface.co/papers?q=readout)下更强。与此同时,一个共享线性映射(https://huggingface.co/papers?q=linear%20map)可从每个分支(包括控制组)解码变量,其解码效果达到经选择校正下限的6.4-9.0倍。在查询位置产生后续可读形式的是在中等深度窗口(https://huggingface.co/papers?q=mid-depth%20window)内进行的注意力介导聚集(https://huggingface.co/papers?q=attention-mediated%20gathering):将补丁深度(https://huggingface.co/papers?q=patch%20depth)与读出(https://huggingface.co/papers?q=readout)深度分离后,在非饱和读出下,该窗口内的传输量至少比任何更浅处高17倍,且无测试过的MLP(https://huggingface.co/papers?q=MLP)输出在其中产生正贡献。在饱和的百分位排名(https://huggingface.co/papers?q=percentile%20rank)下,相同网格未能定位该窗口,这是该度量的固有特性。无需使用该变量的分支聚集程度低七倍,因此该窗口具有需求特异性。该窗口具有两个可测量的边缘:下方存在存活失败,上方存在破坏,且在64层混合模型与另一家族的62层密集模型(https://huggingface.co/papers?q=dense%20model)中处于相同的相对深度。我们定位了变量被安装和读取的位置,而非其传输路径——传输过程本身不携带内容。但读出(https://huggingface.co/papers?q=readout)并非使用情况的校准度量:三个组件将其移动至相互12%范围内,但其对答案的影响差异达7.4倍。

查看arXiv页面 (https://arxiv.org/abs/2608.15022) 查看PDF (https://arxiv.org/pdf/2608.15022) 项目页面 (https://parsa-mz.github.io/innerj/) GitHub0 (https://github.com/parsa-mz/innerj) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15022)

在您的代理中获取此论文:

hf papers read 2608\.15022

没有最新CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.15022以从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.15022以从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2608.15022以从本页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

结构注意力税:检索格式如何独立于内容劫持上下文学习

arXiv cs.CL

本文识别并形式化了'结构注意力税'现象,即检索内容的格式(例如知识图谱三元组)独立于语义相关性扭曲了LLM的注意力分布,导致演示注意力压缩。它提供了正式框架、跨模型和基准的实证证据,并提出了结构感知的缓解策略。