聚集而非接纳:注意力如何将潜在变量转化为可表达形式
摘要
本文探讨语言模型中的注意力机制如何无需选择性门控即可使潜在变量变得可访问,并识别出一个特定需求的中等深度窗口,注意力介导的聚集在此发生。
查看缓存全文
缓存时间: 2026/08/18 07:53
论文页 - 聚集而非准入:注意力如何将潜在变量转化为可表述形式
来源:https://huggingface.co/papers/2608.15022
摘要
在语言模型中,灵活的复用需要在中等深度窗口进行注意力介导的聚集以使潜在变量可读,此过程无需选择性门控,且读出度量难以反映实际使用情况。
语言模型以可报告的形式保存潜在量,当任务要求灵活复用时,该形式中的量会增多。何种原因使表征进入该形式尚不明确,而词工作区(https://huggingface.co/papers?q=workspace)理论提出了一种准入假说:存在决定何物进入的门控。我们通过雅可比透镜(https://huggingface.co/papers?q=Jacobian%20lenses)在开源模型(https://huggingface.co/papers?q=open-weight%20models)上进行测试,并使用一个五个分支共享相同上下文的基准,未发现预期存在的门控机制。需求将概念的透镜可见性提升至超出对提供值施加算子的水平:在我们主要检查点上的百分位排名(https://huggingface.co/papers?q=percentile%20rank)提升+0.050 [+0.045, +0.057](在所有四个测量的检查点上均为正值),尽管该分支的回答已达到天花板效应,且准确率匹配对比在该读出(https://huggingface.co/papers?q=readout)下更强。与此同时,一个共享线性映射(https://huggingface.co/papers?q=linear%20map)可从每个分支(包括控制组)解码变量,其解码效果达到经选择校正下限的6.4-9.0倍。在查询位置产生后续可读形式的是在中等深度窗口(https://huggingface.co/papers?q=mid-depth%20window)内进行的注意力介导聚集(https://huggingface.co/papers?q=attention-mediated%20gathering):将补丁深度(https://huggingface.co/papers?q=patch%20depth)与读出(https://huggingface.co/papers?q=readout)深度分离后,在非饱和读出下,该窗口内的传输量至少比任何更浅处高17倍,且无测试过的MLP(https://huggingface.co/papers?q=MLP)输出在其中产生正贡献。在饱和的百分位排名(https://huggingface.co/papers?q=percentile%20rank)下,相同网格未能定位该窗口,这是该度量的固有特性。无需使用该变量的分支聚集程度低七倍,因此该窗口具有需求特异性。该窗口具有两个可测量的边缘:下方存在存活失败,上方存在破坏,且在64层混合模型与另一家族的62层密集模型(https://huggingface.co/papers?q=dense%20model)中处于相同的相对深度。我们定位了变量被安装和读取的位置,而非其传输路径——传输过程本身不携带内容。但读出(https://huggingface.co/papers?q=readout)并非使用情况的校准度量:三个组件将其移动至相互12%范围内,但其对答案的影响差异达7.4倍。
查看arXiv页面 (https://arxiv.org/abs/2608.15022) 查看PDF (https://arxiv.org/pdf/2608.15022) 项目页面 (https://parsa-mz.github.io/innerj/) GitHub0 (https://github.com/parsa-mz/innerj) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15022)
在您的代理中获取此论文:
hf papers read 2608\.15022
没有最新CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.15022以从本页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.15022以从本页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.15022以从本页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。
注意力衰减、功能标记锚定与大型语言模型中基于注意力的干预的局限性
本文研究了大型语言模型中的短期注意力衰减,发现了一种普遍的指数衰减后趋于平稳的模式,并且功能标记锚定依赖于架构。因果测试表明,增加功能标记上的注意力权重并不会改善检索性能,这表明注意力衰减是描述性的而非规范性的。
结构注意力税:检索格式如何独立于内容劫持上下文学习
本文识别并形式化了'结构注意力税'现象,即检索内容的格式(例如知识图谱三元组)独立于语义相关性扭曲了LLM的注意力分布,导致演示注意力压缩。它提供了正式框架、跨模型和基准的实证证据,并提出了结构感知的缓解策略。
@shikhargupta02: 我一直在学习潜在注意力(来自 DeepSeek)。它不是为每个 token 存储完整的 K 和 V 向量,而是……
作者分享了他用 DeepSeek 的潜在注意力训练一个小模型的见解,观察到潜在空间的使用因层而异,以及一个可以将 KV 缓存减少 4 倍且损失不变的测试时技巧。
视觉-语言模型中可靠性的所在:注意力、隐藏状态与因果电路的机制研究
本文通过证明注意力图的尖锐度并非视觉-语言模型正确性的良好预测指标,挑战了“注意力-置信度假设”。相反,研究表明,隐藏状态的几何特征和自一致性更能反映模型的可靠性,并揭示了晚期融合模型与早期融合模型在架构上的显著差异。