对齐、统一、抑制、路由:Transformer计算的融贯论视角

arXiv cs.CL 论文

摘要

论文介绍了融贯论概率组合理论(CPC),这是一个通过四种操作者角色解释Transformer计算的框架,并在来自五个架构家族的15个模型上进行了验证。

arXiv:2608.22034v1 公告类型:新 摘要:机制可解释性已识别Transformer电路,但缺乏描述其功能如何在任务和架构间组合的共享词汇。我们引入融贯论概率组合理论(CPC),这是一个将Transformer计算基于解释的融贯论理论并通过四种操作者角色进行描述的解释框架。对齐识别候选关系,统一整合支持信息,抑制减少不兼容备选方案,路由将选定信息传递到输出。在来自五个架构家族的15个模型中,抑制、统一和路由的权重空间特征与超出随机基线的保留激活级角色度量相关。抑制比统一在任务间更稳定。消融对齐头在10个模型中减少了下游抑制活动,超出随机头控制,但在无冲突提示上的类似效应表明一般上游依赖,而非矛盾特定耦合。显式矛盾在14个模型中显著改变层间一致性代理;移除共享残差协方差后,差距在每个模型中具有预测方向。基础和指令调优变体保留归纳头分数结构($r{\geq}0.98$),而无操作者特征向后期层的一致偏移。这些结果支持CPC作为比较Transformer机制的共享词汇,同时显示其深度和几何表达仍为架构特定。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:24

# 对齐、统一、抑制、路由:Transformer计算的融贯论视角
来源:https://arxiv.org/html/2608.22034 \\jvol vv\\jnumnn 2026\\docheadPreprint \\affilblock André Freitas1,2邮箱:[[email protected]](mailto:[email protected])机构:曼彻斯特大学,英国邮箱:[[email protected]](mailto:[email protected])机构:Idiap研究所,瑞士

###### 摘要
机制可解释性研究已识别出Transformer电路,但缺乏描述其功能如何在任务和架构间组合的通用术语。本文引入**融贯概率组合主义**(Coherentist Probabilistic Compositionalism, CPC),一种基于融贯解释理论的解释框架,通过四种算子角色描述Transformer计算过程。**对齐**识别候选关系,**统一**整合支持信息,**抑制**减少不相容的选项,**路由**将选定信息传递至输出层。在来自五个架构家族的15个模型中,抑制、统一和路由权重空间特征与超出随机基线的留出层激活级角色度量相关。抑制在任务间的稳定性高于统一。在10个模型中,消融对齐头会减弱下游抑制活动,但类似效果也出现在无冲突提示中,表明这是一种普遍的上游依赖关系,而非特定于矛盾耦合。显式矛盾在14个模型中显著改变逐层连贯性代理指标;去除共享残差协方差后,差距方向与预测一致。基础模型和指令微调模型保持归纳头得分结构(r≥0.98),算子特征未系统性向后层迁移。这些结果支持CPC作为比较Transformer机制的通用术语,同时表明其深度和几何表达仍具有架构特异性。111代码和数据将在接受后公开。

## 1 引言
随着Transformer语言模型规模扩大,其能力已超越表面模式匹配,涌现出上下文学习等行为(51 (https://arxiv.org/html/2608.22034#bib.bib1);49 (https://arxiv.org/html/2608.22034#bib.bib3);70 (https://arxiv.org/html/2608.22034#bib.bib4))。后训练进一步优化模型行为(52 (https://arxiv.org/html/2608.22034#bib.bib21);4 (https://arxiv.org/html/2608.22034#bib.bib22))。机制可解释性旨在通过分析内部组件和计算过程来解释这些行为,通常识别出电路:一组相互作用的组件,共同构成特定计算或行为(68 (https://arxiv.org/html/2608.22034#bib.bib6))。相关分析已识别出归纳头、间接宾语识别(IOI)电路、复制抑制头、前馈记忆及指令条件冲突解决机制(15 (https://arxiv.org/html/2608.22034#bib.bib8);21 (https://arxiv.org/html/2608.22034#bib.bib5);51 (https://arxiv.org/html/2608.22034#bib.bib1);68 (https://arxiv.org/html/2608.22034#bib.bib6);45 (https://arxiv.org/html/2608.22034#bib.bib7);69 (https://arxiv.org/html/2608.22034#bib.bib23);62 (https://arxiv.org/html/2608.22034#bib.bib13);2 (https://arxiv.org/html/2608.22034#bib.bib20))。这些机制在各自层面上已得到充分描述,但其功能角色如何融入更广泛的Transformer计算框架尚不明确。

现有框架在不同抽象层面探讨此问题。贝叶斯与算法分析将提示视为隐式任务推断的证据或隐式估计器的输入(72 (https://arxiv.org/html/2608.22034#bib.bib15);1 (https://arxiv.org/html/2608.22034#bib.bib16);67 (https://arxiv.org/html/2608.22034#bib.bib18);18 (https://arxiv.org/html/2608.22034#bib.bib17)),抽象掉了实现计算的具体组件。特征级分析将激活分解为可解释方向(14 (https://arxiv.org/html/2608.22034#bib.bib9);33 (https://arxiv.org/html/2608.22034#bib.bib10);8 (https://arxiv.org/html/2608.22034#bib.bib12)),主要刻画表征内容及其局部因果作用,较少关注该内容如何在不同深度被组合与修正。电路分析识别因果组件和可复用计算结构(73 (https://arxiv.org/html/2608.22034#bib.bib47);28 (https://arxiv.org/html/2608.22034#bib.bib67);3 (https://arxiv.org/html/2608.22034#bib.bib19)),但未解决如何通过跨任务和架构泛化的渐进角色来描述重复出现的功能。

我们通过将这些功能组织成基于**连贯性精炼**的通用术语来填补此空白:即模型通过关联表征片段并逐步解决其矛盾来解释上下文。我们测试了这些功能的组织方式如何随任务、架构和后训练方法变化。

图1:给予帧运行示例上的CPC术语。部分线索进入,对齐提出候选角色链接,统一整合兼容分配,抑制修剪不相容的接受者,路由将一致的解释传递给读出层,连贯性随深度增加。图例命名了每个算子的特征机制,相同算子也涵盖事实回忆、矛盾处理和指令微调。单个机制可能实例化一个或多个算子角色。

由于语言是推断与指称关系的结构化场域,合理的延续受到语篇实体、语义角色及早期语境建立的连贯关系的约束,而非仅表面邻近性(24 (https://arxiv.org/html/2608.22034#bib.bib52);23 (https://arxiv.org/html/2608.22034#bib.bib53);16 (https://arxiv.org/html/2608.22034#bib.bib51))。对于基于标记的语言模型,这些关系必须通过分布在标记位置的表征来实现。表征关联提及、角色和事件,模型必须在上下文扩展时保持它们的一致性(参见图2 (https://arxiv.org/html/2608.22034#S3.F2))。自监督语言模型编码了这些结构的若干方面,包括句法依存、语义角色和共指(63 (https://arxiv.org/html/2608.22034#bib.bib55);43 (https://arxiv.org/html/2608.22034#bib.bib54);32 (https://arxiv.org/html/2608.22034#bib.bib56))。模型可通过关联上下文片段、整合兼容信息、减少对矛盾的支持、并将解释传递至预测位置来利用此结构(51 (https://arxiv.org/html/2608.22034#bib.bib1);68 (https://arxiv.org/html/2608.22034#bib.bib6);21 (https://arxiv.org/html/2608.22034#bib.bib5);45 (https://arxiv.org/html/2608.22034#bib.bib7))。我们提出**连贯性精炼**作为组织这些操作的术语体系的原则,并将其形式化为**融贯概率组合主义**(CPC)。在CPC中(图1 (https://arxiv.org/html/2608.22034#S1.F1)),Transformer计算被建模为在**全局连贯泛函**C下表征片段的迭代精炼,跨层组件可实例化四种算子角色以实现这些操作:**对齐**、**统一**、**抑制**和**路由**。每个角色描述了单个组件(例如注意力头或前馈层)对发展中的解释的贡献:单个组件可能服务多个角色,一个角色也可能分散于多个组件。经验问题是权重和激活在多大程度上承载这些角色的可测量特征。我们将其视为建模假设,在不假设Transformer直接优化C的情况下,组织已知机制并生成可检验预测。

经验评估考察四个维度:(i)算子特征的可重复性与功能有效性(P1);(ii)抑制对上游对齐的依赖性(P2);(iii)矛盾对靠近高对齐与抑制活动层附近的连贯代理指标的影响(P3);(iv)后训练在多大程度上重新加权算子结构或引入新结构(P4)。

本文有三项贡献:
- • 一个将Transformer计算描述为由四种算子角色执行的连贯性精炼的解释框架,为机制发现提供共享表征语言(第3节 (https://arxiv.org/html/2608.22034#S3))。
- • 注意力头算子特征的可操作定义,包括激活级度量和对其提议功能的因果检验(第3.4节 (https://arxiv.org/html/2608.22034#S3.SS4) 和第5.3节 (https://arxiv.org/html/2608.22034#S5.SS3))。
- • 对来自五个架构家族的15个模型的经验评估,识别该术语体系中哪些特性在架构间可泛化(第5节 (https://arxiv.org/html/2608.22034#S5))。

## 2 语言与认知中的连贯性
连贯性已在哲学和语言学中得到研究。在哲学中,理论持认识论观点,认为信念的合理性部分取决于其与推理者所持更广泛信念体系的契合程度(7 (https://arxiv.org/html/2608.22034#bib.bib57))。在语言学中,连贯性用于描述使语篇可作为结构整体(而非任意句子序列)被解释的文本单元间的关系(29 (https://arxiv.org/html/2608.22034#bib.bib63);35 (https://arxiv.org/html/2608.22034#bib.bib62))。尽管研究对象不同,两种视角都将连贯性视为关系属性:元素的评估基于其与其他元素的契合度,而非孤立判断。

### 2.1 语言与语篇中的连贯性
在语言学情境中,连贯性通常通过**连贯关系**研究:连接分句、句子或更大语篇跨度的语言单元之间的关系(29 (https://arxiv.org/html/2608.22034#bib.bib63))。它们解释了语篇的一部分如何相对于另一部分被解释。例如,两个跨度可能构成因果、阐释、时间或对比关系(35 (https://arxiv.org/html/2608.22034#bib.bib62))。最广泛使用的理论之一是修辞结构理论,它通过语篇跨度间的关系(如**阐释**、**原因**和**对比**)来表示文本,从而形式化此观点(42 (https://arxiv.org/html/2608.22034#bib.bib58))。35 (https://arxiv.org/html/2608.22034#bib.bib62) 区分了局部连贯与全局连贯。局部连贯指文本相邻部分的连接方式,有三个主要来源:(i)相邻文本跨度间的连贯关系,(ii)语篇实体的连续性,即连续跨度围绕相同人物、物体或事件,以及(iii)词汇或语义连续性,即相邻跨度保持在兼容的主题或语义场内。全局连贯关注语篇在较长文本跨度上的组织,包括单个句子和局部关系如何贡献于整体语篇结构。若干计算方法分别形式化这些来源。

衔接模型描述通过重复、指称和词汇关系形成的表层链接(24 (https://arxiv.org/html/2608.22034#bib.bib52))。基于实体的模型描述语篇实体如何被引入和维持。例如,中心理论追踪话语间注意力焦点的变化,并预测当过渡保持显著的语篇实体时连贯性更强(23 (https://arxiv.org/html/2608.22034#bib.bib53))。另一方面,语义方法测量相邻文本表征间的兼容性。更新近的计算模型从连贯与重排序文本中学习这种兼容性,产生区分良好构建语篇与连贯性较差备选方案的分数(39 (https://arxiv.org/html/2608.22034#bib.bib59))。这些方法在何为语篇单元及如何测量兼容性上存在差异,但都将连贯性描述为文本各部分间关系。

一个重要结果是语义对立本身并不意味着不连贯。语篇可能包含分歧、对比、纠正或让步,同时保持连贯,只要对立内容间的关系被明确表示。例如,**对比**本身在修辞结构理论中就是一种连贯关系(42 (https://arxiv.org/html/2608.22034#bib.bib58))。下文中的**不相容**指在单一解释中无法共同维持的两种分配。

### 2.2 连贯性作为约束满足
更通用的形式化将连贯性视为约束满足问题。64 (https://arxiv.org/html/2608.22034#bib.bib60) 定义有限元素集E={e₁,...,eₙ},元素对间有带权重的正负约束。正约束连接相互支持或契合的元素,负约束连接相互冲突的元素。一个解将元素划分为接受集𝒜和拒绝集R。eᵢ和eⱼ之间的正约束在两元素获得相同状态时满足,负约束在两者一接受一拒绝时满足。划分的连贯性可写为:
W(𝒜,ℛ)=∑_{(e_i,e_j) satisfied}w_{ij},
(1)
其中wᵢⱼ是元素eᵢ和eⱼ间约束的权重。连贯性问题是找到最大化W的划分。精确最大化此目标计算难度大。连接主义近似将元素表示为网络中的单元,正约束为兴奋性连接,负约束为抑制性连接(64 (https://arxiv.org/html/2608.22034#bib.bib60))。相互支持的元素彼此强化,相互冲突的元素相互竞争。网络逐渐稳定到一个配置,其中兼容元素倾向于共同活跃,不相容选项被分离。65 (https://arxiv.org/html/2608.22034#bib.bib61) 将此通用表述应用于不同认知问题,包括解释、感知、类比和决策。元素和约束因领域而异,但潜在问题保持不变:找到一个满足尽可能多相互加权约束的配置。

此形式化为认识论与语言学视角提供了有用桥梁。在语篇中,元素可对应命题、实体、事件或语篇跨度。正约束可表示支持共同解释的关系,如共指、因果关系或兼容的语义角色。负约束可表示互不相容的分配。连贯性取决于这些关系在解释中的配置。

## 3 融贯概率组合主义
CPC通过残差流中逐层构建的解释来描述Transformer计算。算子角色规定了功能贡献

相似文章

论Transformer的表达能力

arXiv cs.AI

一篇综述论文,考察Transformer作为语言识别器的表达能力,运用电路复杂性的概念和方法将其与经典计算模型进行比较。

Transformers 本质上是简洁的

Hacker News Top

本文认为 Transformer 架构本质上是简洁的,意味着它们比其他模型能更高效地表示某些函数。本文提供了理论分析和证明。