超越余弦相似度:重新思考大语言模型中的层相关性
摘要
本文证明,余弦相似度作为评估大语言模型中层重要性的指标效果不佳,并提出使用层移除后实际准确率下降作为更稳健的度量标准。
arXiv:2605.14075v1 公告类型:新\n摘要:大语言模型(LLMs)彻底改变了自然语言处理。理解其内部机制对于开发更可解释和优化的架构至关重要。机制可解释性导致开发了多种评估层相关性的方法,其中余弦相似度是该领域广泛使用的工具。在这项工作中,我们证明余弦相似度是衡量层移除后实际性能下降的一个糟糕的代理指标。我们的理论分析表明,一个层可能表现出任意低的余弦相似度分数,但同时对模型性能至关重要。另一方面,来自一系列LLMs的经验证据证实,余弦相似度与实际性能下降之间的相关性通常较弱或中等,这导致了对Transformer内部机制的误导性解释。我们提出了一种更稳健的层相关性评估指标:移除层后模型准确率的实际下降。尽管这是一个计算成本较高的度量,但这种方法提供了更准确的层重要性图景,允许更明智的剪枝策略和轻量级模型。我们的发现对可解释LLMs的开发具有重要意义,并强调了在评估层相关性时超越余弦相似度的必要性。
查看缓存全文
缓存时间: 2026/05/15 06:27
# 重新思考大语言模型中超越余弦相似度的层相关性 来源: https://arxiv.org/html/2605.14075 Cristian Hinostroza¹,², Rodrigo Toro Icarte¹,², Christ Devia²,³, Andres Carvallo², Eugenio Herrera-Berg²,Denis Parra¹,²,Jorge F. Silva²,³ ¹智利天主教大学 ²国家人工智能中心(CENIA) ³智利大学 ###### 摘要 大语言模型(LLMs)已经彻底改变了自然语言处理。理解其内部机制对于开发更具可解释性和优化性的架构至关重要。机械可解释性催生了多种评估层相关性的方法,其中余弦相似度是该领域广泛使用的工具。在本工作中,我们证明余弦相似度并不能很好地反映层移除所造成的实际性能下降。我们的理论分析表明,一个层可能表现出任意低的余弦相似度分数,同时仍然对模型性能至关重要。另一方面,来自一系列LLMs的经验证据证实,余弦相似度与实际性能下降之间的相关性通常较弱或中等,从而导致对Transformer内部机制的误导性解释。我们提出了一种更稳健的度量方法来评估层相关性:移除某一层后模型准确率的实际下降量。尽管这一度量计算成本高昂,但它能更准确地反映层的重要性,从而支持更明智的剪枝策略和轻量级模型。我们的发现对开发可解释的LLMs具有重要意义,并强调了在评估层相关性时超越余弦相似度的必要性。 ## 1 引言 Transformer(Vaswani et al.,2017 (https://arxiv.org/html/2605.14075#bib.bib1))最初是为大语言模型(LLMs)相关任务设计的(Chkirbene et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib41)),如今已成为现代AI的主要架构。它们现已支持计算机视觉(Caron et al.,2021 (https://arxiv.org/html/2605.14075#bib.bib10))、强化学习(Li et al.,2023a (https://arxiv.org/html/2605.14075#bib.bib3))、多模态学习(Xu et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib11))、推荐系统(Villa et al.,2020 (https://arxiv.org/html/2605.14075#bib.bib16))等领域的应用。由于这些模型在AI中扮演核心角色,找出哪些部分最重要,可以引导我们走向更可解释和更优化的架构。 *机械可解释性*旨在对预训练LLMs进行逆向工程,以更好地理解它们的工作原理(Ferrando et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib54))。在此背景下,余弦相似度已成为评估内部表示之间语义关系的标准工具(Sanh et al.,2019 (https://arxiv.org/html/2605.14075#bib.bib50); Li et al.,2023b (https://arxiv.org/html/2605.14075#bib.bib53); Sun et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib17); Model et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib48))。直观上,当两个词元嵌入之间的夹角很小时,这些词元被认为编码了相似的信息。最近的研究使用余弦相似度来评估预训练LLMs中的层相关性(例如, Sajjad et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib51); He et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib35); Men et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib33); Zhang et al.,2024b (https://arxiv.org/html/2605.14075#bib.bib39); Sun et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib17); Yang et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib49))。核心思想是:对其输入向量改变最小的层被认为相关性较低,相关性量化为1减去层输入和输出向量之间的余弦相似度。该分数已应用于多种场景:例如,Gromov et al.(2025 (https://arxiv.org/html/2605.14075#bib.bib34))用它来剪枝模型并分析跨任务性能,发现推理任务比事实性任务需要更多层。类似地,He et al.(2024 (https://arxiv.org/html/2605.14075#bib.bib35))可视化了跨数据集的层相关性分数(图1 (https://arxiv.org/html/2605.14075#S1.F1)B),显示某些层无论任务如何都始终表现为不相关。虽然这些结果提供了有价值的见解,但它们依赖于一个假设——余弦相似度是层相关性的可靠指标,而我们对这一假设提出质疑。在本文中,我们证明余弦相似度并不能很好地反映层移除所造成的实际性能下降。例如,OLMo中的第16层根据余弦相似度似乎相关性较低,如图1 (https://arxiv.org/html/2605.14075#S1.F1)B所示(相关性低的层用黄色表示)。然而,移除该层会导致所展示的十个数据集平均准确率下降66%。事实上,仅移除第16层就将OLMo在ARC-C上的性能降到了随机水平。这些发现表明,依赖余弦相似度作为相关性度量可能会导致对Transformer内部机制的误解。 参见说明 图1:OLMo(Groeneveld et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib44))各层在十个数据集上的相关性。A. 基于准确率的相关性分数:我们测量移除层后任务准确率的下降,以评估各层的相关性。移除后准确率上升的层用绿色高亮,准确率不受影响的层显示为白色,移除后降低模型准确率的层用红色/紫色表示。B. 使用余弦相似度分数计算的相关性分数,该分数衡量每个层对其输入的变换程度。最不相关的层显示为黄色。 在本文中,我们给出一个形式化证明,表明一个层可能表现出任意低的余弦相似度分数,同时仍然对模型性能至关重要。特别地,移除这样的层可能会极大地改变模型的输出——可能将其准确率从完美降至零。这种现像发生的原因是,该层对其输入向量引入了一个微小的修改,而这个修改随后被下游层放大,从而产生雪球效应。因此,尽管其余弦相似度分数接近零,但移除该层可能会严重破坏模型的最终预测。然后我们证明,这种理论上的最坏情况在实践中确实在一定程度上存在。经验上,我们发现余弦相似度与实际性能下降之间的相关性通常较弱或中等,具体取决于模型。结果,在我们研究的超过90%的案例中,余弦相似度要么高估要么低估了层的真实相关性。 在确定了余弦相似度作为层相关性评估指标不可靠之后,我们接下来研究使用更稳健的替代指标重新运行先前提出的实验会带来什么影响。具体而言,我们认为就机械可解释性的目的而言,最合适的度量是移除某层后模型准确率的实际下降量。虽然这种方法计算成本高昂——需要逐层移除并重新评估性能——但它避免了余弦相似度固有的缺陷。关键在于,该度量捕捉了Transformer架构中层与层之间复杂的相互依赖关系。 我们首先复现了He et al.(2024 (https://arxiv.org/html/2605.14075#bib.bib35))引入的层相关性可视化。图1 (https://arxiv.org/html/2605.14075#S1.F1)A显示了OLMo中每个层在十个数据集上的相关性,通过单独移除每层后模型准确率的变化来衡量。红色/紫色表示准确率下降,绿色表示提升,白色表示无变化。这种可视化提供了与余弦相似度截然不同的视角,揭示出层相关性因数据集而异,并突显了第8层和第16层在OLMo性能中的关键作用。 然后我们复现了Gromov et al.(2025 (https://arxiv.org/html/2605.14075#bib.bib34))提出的任务分析,该分析基于余弦相似度剪枝被认为不相关的层,并观察由此带来的性能下降。我们则根据任务训练集上准确率的实际下降来对层进行排序,并据此进行剪枝。结果如图2 (https://arxiv.org/html/2605.14075#S1.F2)所示。由于我们的度量能更好地反映层相关性,HellaSwag上的性能下降不如原始研究那么显著。这对“所有层对于推理任务都是必需的”这一结论提出了挑战:使用更具信息量的度量,我们发现即使移除22%的层,仍能保持超过75%的准确率。 参见说明 图2:我们使用Gromov et al.(2025 (https://arxiv.org/html/2605.14075#bib.bib34))提出的基于余弦相似度的剪枝策略评估LLaMA-3-8B,并将其与我们的方法进行比较。与余弦相似度形成对比,我们的方法缓解了推理任务中的即时性能下降,突显了选择合适的度量来解释模型内部机制的关键作用。 最后,我们在结构化剪枝(Anwar et al.,2017 (https://arxiv.org/html/2605.14075#bib.bib19))中进行了实际应用,其目标是在最小化性能影响的前提下移除已训练模型中的层。在任务依赖的设置中,我们表明,基于我们提出的准确率相关性分数进行剪枝,比现有方法(包括Taylor近似(Kim et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib36); Ma et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib37))、余弦相似度(He et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib35); Men et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib33); Gromov et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib34))以及FinerCut(Zhang et al.,2024b (https://arxiv.org/html/2605.14075#bib.bib39)))取得了更优的结果。在任务无关的设置中,我们的方法也达到了最佳性能,尽管它对校准数据集的选择较为敏感。 ## 2 相关工作 Transformer研究中一个核心挑战是准确测量层相关性。这个问题对于两个主要应用至关重要:机械可解释性(旨在理解预训练LLMs的工作方式)和结构化剪枝(旨在通过移除不相关的层来减小模型大小,同时保持性能)。余弦相似度由于计算效率高且直观,已成为这两种任务的流行度量(例如, Sajjad et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib51); Gromov et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib34); He et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib35); Men et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib33); Yang et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib49); Zhang et al.,2024b (https://arxiv.org/html/2605.14075#bib.bib39))。它假设对其输入向量改变最小的层相关性较低。此外,基于余弦的剪枝在任务无关设置中取得了不错的结果。然而,余弦相似度只是一个代理指标,真正重要的是下游性能。尽管先前的工作对其在比较词元嵌入方面的使用提出了担忧(Timkey and Van Schijndel,2021 (https://arxiv.org/html/2605.14075#bib.bib2)),但据我们所知,这是第一个在理论和经验上严格评估其在Transformer模型中估计层相关性方面局限性的研究。然后我们提出了一种替代方案:基于准确率的相关性分数,该分数认为只有当移除某层后显著降低给定任务的性能时,该层才被认为是相关的。 除了通常用作局部度量的余弦相似度(例如, Sajjad et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib51); Gromov et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib34); He et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib35); Men et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib33))之外,还提出了几种全局度量。这些度量通过评估移除某层后模型输出的变化来评估相关性。全局度量分为两类:基于一致性的和基于性能的。基于一致性的度量比较有和没有目标层时模型的输出分布(Sieberling et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib55); Yang et al.,2026 (https://arxiv.org/html/2605.14075#bib.bib47); Zhang et al.,2024b (https://arxiv.org/html/2605.14075#bib.bib39)),识别那些移除后输出不变的层。然而,这些度量关注的是输出不变性而非预测准确性,可能会忽略那些微妙影响性能的层。 基于性能的度量与我们的方法更为一致(Kim et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib36); Ma et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib37); Zhong et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib38); Song et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib46))。这些度量依赖真实信息来评估层的相关性。例如,Ma et al.(2023 (https://arxiv.org/html/2605.14075#bib.bib37))使用Taylor展开来估计移除某层后损失的预期变化。其他工作则依赖基于困惑度的分数,认为如果移除某层后困惑度没有显著增加,则该层不相关(Kim et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib36); Zhong et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib38); Song et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib46))。与我们的基于准确率的分数类似,这些方法旨在识别那些排除后性能下降最小的层。然而,正如我们在第6节 (https://arxiv.org/html/2605.14075#S6)中所展示的,我们的度量在结构化剪枝任务中始终优于这些替代方案。 最后,我们的工作与更广泛的关于理解Transformer如何表示和处理信息的文献相联系(Brinkmann et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib29); Clark et al.,2019b (https://arxiv.org/html/2605.14075#bib.bib22); Devlin et al.,2019 (https://arxiv.org/html/2605.14075#bib.bib23); Geva et al.,2021 (https://arxiv.org/html/2605.14075#bib.bib18);2022 (https://arxiv.org/html/2605.14075#bib.bib20);2023 (https://arxiv.org/html/2605.14075#bib.bib25); Gurnee and Tegmark,2024 (https://arxiv.org/html/2605.14075#bib.bib26); Jawahar et al.,2019 (https://arxiv.org/html/2605.14075#bib.bib21); Lioubashevski et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib31); Meng et al.,2022 (https://arxiv.org/html/2605.14075#bib.bib24); Sun et al.,2025 (https://arxiv.org/html/2605.14075#bib.bib17); Tigges et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib30))。特别是,我们的相关性度量可用于重新审视那些识别特定注意力层(Clark et al.,2019b (https://arxiv.org/html/2605.14075#bib.bib22); Geva et al.,2023 (https://arxiv.org/html/2605.14075#bib.bib25))或MLP层(Geva et al.,2021 (https://arxiv.org/html/2605.14075#bib.bib18); Meng et al.,2022 (https://arxiv.org/html/2605.14075#bib.bib24))中功能行为的研究,从而为其贡献提供新的见解。它还可能有助于桥接关于Transformer全局行为的研究发现(Gurnee and Tegmark,2024 (https://arxiv.org/html/2605.14075#bib.bib26); Brinkmann et al.,2024 (https://arxiv.org/html/2605.14075#bib.bib29); Tigges et al.,2023 (h
相似文章
论词汇性在大语言模型中的持续影响
本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。
通过决策表征转变理解层剪枝大型语言模型中的性能崩溃
本文通过引入决策表征指标,分析了层剪枝 LLM 中的性能崩溃现象,并确定了维持模型完整性所关键的“沉默期”。
超越逐层稀疏性中的层重要性:一种层间扰动吸收视角
本文提出了一种用于大语言模型逐层稀疏性的层间扰动吸收视角,表明不同层对剪枝扰动表现出异质性响应,并引入了一种吸收感知校正方法,通过降低困惑度和提升准确率来改进现有剪枝方法。
余弦相似度具有误导性:辅助损失重塑了视觉语言模型,而非其潜变量
该论文挑战了“监督潜变量与视觉目标之间的余弦对齐能提高视觉语言模型准确性”的假设,发现了强烈的负相关。引入了PRISM诊断方法,揭示答案是从潜变量下游解码的,而非潜变量内部,并且辅助损失通过共享参数重塑了语言模型。
一层解释所有:理解大型语言模型中的大规模激活现象
本文识别出大型语言模型(LLM)中极端激活现象产生并传播的“大规模涌现层(Massive Emergence Layer)”,并提出一种缓解其僵化性、提升模型在数学推理和指令遵循等任务上性能的方法。