因果结构可诱导但功能解耦:类型化机制库中的路由/读出边界
摘要
本文研究Transformer如何组织因果知识,表明类型级监督会诱导一种类型化的路由结构,该结构在功能上与答案读出解耦,并具有精确的局部可编辑性和位精确的可还原性。
arXiv:2608.11767v1 公告类型:new
摘要:当语言模型回答干预性问题时,它必须执行的计算取决于查询所需的证据类型。我们报告了Transformer在组织因果知识时的一种解耦:由类型级监督诱导的按类型划分的槽位结构组织了路由,但在功能上与答案读出解耦。我们通过一个类型化机制库——按证据类型划分的离散机制槽位,可在状态级别审计——在一个具有精确干预性ground truth的因果世界基准上,采用冻结协议,在两个规模(22.6M和125M)下建立了这一发现。四项预注册发现:(i)起源。按类型划分的槽位组织是由类型级监督诱导的:在架构相同的无监督对照组中不存在,无法通过无内容门控标签获得,并且在统计上可归因于监督信号;在125M规模下通过功效充分的预注册协议进行了复制(全部九个单元通过)。(ii)边界。诱导出的结构是一个类型化路由索引,具有清晰的路由/读出边界:槽位代码支撑路由,但不驱动答案读出($|\Delta\hat{y}| \le 3.4\times10^{-6}$,零附带影响,三个种子,在5.6倍规模窗口内稳定)——因此我们不提出行为可编辑性主张。(iii)成本。该结构是免费的:LM质量与参数匹配的单体模型相差在0.0082 nats以内。(iv)可信度。库状态在编辑下精确局部,并且位精确可还原——每个种子250次单次编辑和1,000次堆叠还原,零失败。我们进一步发现,无监督零模型本身会随规模移动,因此在某个规模上校准的零模型用于另一个规模的比较可能会被混淆。每项主张都与一个预注册的、机器可检查的标准绑定,该标准在它所管理的数据之前归档;完整的审计轨迹(包括我们失败的一项标准以及冻结协议如何处理它)作为附录发布。
查看缓存全文
缓存时间: 2026/08/13 15:28
# 因果结构可被诱导,但在功能上解耦:类型化机制库中的路由/读出边界
来源:https://arxiv.org/html/2608.11767
###### 摘要
当语言模型回答一个干预性问题时,它必须执行的计算取决于查询所要求的*证据类型*——不同的类型对应不同的计算。我们报告了 transformer 在组织因果知识时存在一种**解耦**:由类型级监督诱导出的 slot×\times类型结构组织了*路由*,却与答案*读出*在功能上保持解耦。我们通过一个**类型化机制库**——即离散的机制槽,按证据类型划分,可在状态层面寻址和审计——作为测量工具,在一个具有精确干预 ground truth 的因果世界基准上,在冻结的评估协议下,于两个规模(22.6M 和 125M)上确立这一点。四项预注册发现。(i) **来源。**Slot×\times类型组织是*由*类型级监督*诱导*的:它在架构相同的无监督对照组中不会涌现;它无法通过无内容的门控标签买到;并且在它出现的地方,可以在统计上归因于监督信号,在 125M 规模下通过有功效的、预注册的归因协议复现(三个新种子、两个新无监督对照、1,280 条新查询;九个标准单元全部通过门控)。(ii) **边界。**诱导出的结构是一个类型化路由索引,具有清晰的路由/读出边界:结构性的槽代码支撑路由,但并不驱动答案读出(\|Δy^\|≤3.4×10−6\|\\Delta\\hat\{y\}\|\\leq 3.4\\times 10^\{\-6\},且完全零附带影响,三个种子,在 5.6×\times规模窗口内稳定)——因此我们不提出任何行为可编辑性主张。(iii) **成本。**该结构是免费的:LM 质量与参数匹配的单体模型相差不超过 0.0082 nats(预注册容差,三个种子;行为测试组 50/50)。(iv) **可信度。**库状态在编辑下精确局部,并且**逐位可逆**——每个种子 250 次单编辑和 1,000 次堆叠回滚,三个种子,零失败——这是一个可审计的因果知识状态管理基底,其性质由构造保证,并依据预注册标准得到验证。我们进一步发现,**无监督零假设本身会随规模移动**——即移动零假设——这限定了组织主张如何跨规模继承(§4.1 (https://arxiv.org/html/2608.11767#S4.SS1)):在某个规模校准的零假设若被另一个规模复用,可能会受到混淆。上述每项主张都与一个预注册的、机器可检查的标准绑定,且该标准在它所约束的数据之前即已存档;完整审计轨迹——包括我们失败的一项标准以及冻结协议如何处理它——作为附录发布。
## 1 引言
大量因果推理和可解释性研究建立在一个我们称之为**电路板直觉**的隐含假设之上:如果我们能暴露一种离散的内部结构——一个槽、一个神经元、一条回路——并修改它,这种修改应该会体现在模型的输出中。定位-编辑方法写入局部权重;探针和电路分析读出结构,并将其视为计算本身。这种直觉是承重性的:没有它,暴露结构只能带来理解,却无法带来控制。这是真的吗?我们构建了一个受控平台来端到端地检验这个假设,答案是——否,而且是在精确、可测量、可复现的意义上。
该平台是一个具有精确干预 ground truth 的**因果世界**测试平台,外加一个建立在标准 transformer 骨干(Vaswani 等人,2017 (https://arxiv.org/html/2608.11767#bib.bib26))之上的**类型化机制库**(MM):NN 个离散槽,按证据类型(身份、关系、符号……)静态划分,并由一个门控头通过小型辅助损失训练,以鼓励类型一致的路由。真实文本语料将证据类型与主题、词汇线索和频率混杂在一起;在这里,每个世界都是一个小的结构化因果模型,干预 ground truth 可以精确计算,且每条查询都带有已知的证据类型——在两种规模下(22.6M 和 125M 参数)。一个架构选择使得即将到来的否定结果具有信息量而并非琐碎:该库是模型*唯一可写的因果状态*,骨干网络消费的是库中介的表示——该架构为显式结构提供了走上读出路径的一切条件。训练用这个机会做了什么,就是实证问题。
三个问题组织全文。**类型化组织从哪里来**——它是免费涌现的,还是可以被任意监督买到,抑或是被*关于*某物的监督所诱导?**这种结构是做什么的**——它位于产生答案的通路上,还是一种副现象索引?以及**它付出什么代价、又有什么可信度**——这种结构是否降低了基础模型,其状态能否被精确编辑和审计?我们的目标*不是*改善因果推理本身——本文中每项能力结果都是对齐/持平结果——而是在预注册标准下测量,显式因果状态能够提供什么、又不能提供什么。
**贡献。**发现优先;产生发现的仪器是第三项贡献;协议则是让这一切可信的方式。
1. 1. **科学发现:路由/读出边界(H-α\\alpha)。**诱导出的 slot×\times类型结构支撑路由,但不驱动答案读出:150/150 次结构编辑将读出移动 ≤2×10−4\\leq 2\\times 10^\{\-4\},且完全零附带影响(标准协议下 \|Δy^\|≤3.4×10−6\|\\Delta\\hat\{y\}\|\\leq 3.4\\times 10^\{\-6\},三个种子),在 5.6×\times规模窗口内稳定。该边界否定了显式状态架构的电路板直觉——而且这并非架构上的琐碎结论:训练将一个本为参与而构建的结构解耦了。
2. 2. **来源,已归因:被诱导,而非涌现,也不可购买。**Slot×\times类型组织由类型级监督诱导(置换检验 MI):无内容门控标签无法学习(两种协议,四个种子,22.6M);无监督对照在 22.6M 下不显示组织;监督效应跨三个种子复现(z = 4.47/5.99/7.02,Stouffer z = 10.1;超额 0.072–0.124 nats,按冻结分级为中等效应等级)。在 125M 下,可归因增量针对两个新的无监督对照,在预注册配对归因门控下复现:三个新的类型种子通过幅度门槛(z = 15.15/13.20/13.77;相对冻结的 ≥0.10\\geq 0.10,超额为 0.1275/0.1025/0.1202 nats),所有六组配对对比均通过冻结的 zΔ≥3z\_\{\\Delta\}\\geq 3 门槛(5.02–7.87;存档 A20.21)。
3. 3. **方法论警示:移动零假设。**无监督零假设并非无标度性质:一个结构先验控制在 22.6M 下位于零假设上,但在 125M 下携带微弱但稳定的组织(z=2.38;§4.1 (https://arxiv.org/html/2608.11767#S4.SS1))。在一个规模校准、在另一个规模评估的组织主张,可能继承一个已不再适用的零假设。我们发布为此而生的配对置换归因协议——冻结交集门控、冻结边条款并精确规定唯一补救措施(在任何复现数据之前冻结的有功效复现)——作为一个可复用模板。
4. 4. **仪器:零成本、可审计的状态管理基底。**类型化库(125M 下 600 个槽、6 种证据类型)在 LM 质量上没有任何可测量的成本(预注册容差下差距 ≤0.0082\\leq 0.0082 nats;测试组两臂均为 50/50);编辑具有完全零非路径附带影响(三个种子);回滚审计完全通过——单编辑和深度 20 的堆叠回滚,骨干零接触、失败编辑零污染契约,三个种子,零失败。
## 2 架构
identitychildrelationsignconfidencereserved机制库——600 个类型化槽(唯一可写的因果状态)类型化门控头λg=0.1\\lambda\_\{g\}\{=\}0.1(类型)⋅\\cdotλg=0\\lambda\_\{g\}\{=\}0(涌现 / 分块)Gumbelτ\\tau退火⋅\\cdotβ\\beta下限 0.3⋅\\cdotλlb\\lambda\_\{lb\}0.01编辑会话快照→\\to编辑→\\to撤销翻转符号⋅\\cdot加边⋅\\cdot删边⋅\\cdot交换边⋅\\cdot参数编辑因果 LM 骨干116.66M 参数(训练后冻结)证据token答案读出头路由logits库中介特征×\times结构代码不在读出路径上(H-α\\alpha,标度不变 22.6M→\\to125M)仅库写入(任意槽)⋅\\cdot骨干零接触逐位回滚:250/250 编辑 + 1,000/1,000 层×\times3 个种子(A22)
图 1:架构概览(mm125:总计 126.21M;N=600 槽,6 种证据类型)。绿色路径:带审计的逐位回滚编辑接口(A22,§4.5 (https://arxiv.org/html/2608.11767#S4.SS5))。虚线橙色路径:所测量的 H-α\\alpha 边界(§4.2 (https://arxiv.org/html/2608.11767#S4.SS2))。
### 2.1 机制库
该库是一个包含 N 个类型化槽的张量(125M 配置下 N=600,22.6M 下 N=200)。槽按证据类型静态划分(125M 下 6 种类型:identity / child / relation / sign / confidence / block-reserved;22.6M 下 3 种类型),并设有每类型下限(βfloor=0.3\\beta\_\{\\mathrm\{floor\}\}=0.3)以防止坍缩。每个槽携带机制载荷(边列表、符号位、标量参数)和审计缓冲(使用计数器),它们是模型 state\_dict 的一部分,因此也是每个快照的一部分。
### 2.2 类型化路由与门控
证据 token 通过门控头路由到槽。三种门控模式定义了我们的一臂结构:type(由类型分类辅助损失 λg=0.1\\lambda\_\{g\}=0.1 监督)、emergent(λg=0\\lambda\_\{g\}=0,自由路由)和 blocks(λg=0\\lambda\_\{g\}=0,无类型标签的块结构路由先验)。两个无监督臂是组织主张的零假设模型:它们表现出的任何 slot×\times类型对齐,都是不能归功于监督的组织。Gumbel 噪声(Jang 等人 2017 (https://arxiv.org/html/2608.11767#bib.bib11);Maddison 等人 2017 (https://arxiv.org/html/2608.11767#bib.bib17))(τ\\tau 在前 1,500 步退火)塑造早期探索;熵下限和负载均衡项(λlb=0.01\\lambda\_\{lb\}=0.01)防止退化路由。
### 2.3 编辑接口
编辑通过 EditSession 应用:快照库状态→\\to应用操作符→\\to(可选)验证→\\to提交或撤销。四种结构操作符(flip\_sign、add\_edge、remove\_edge、swap\_edge)加上一个有界参数操作符(param\_edit,≤\\leq50 步,行掩码 lr 10−310^\{\-3\})覆盖库的可写维度。组合是原生支持的:compose\_legal 在应用前根据库不变量验证操作符序列。所有操作符都是人类可读的状态变换——但它们对行为的改变受 H-α\\alpha 约束(§4.2 (https://arxiv.org/html/2608.11767#S4.SS2)),我们据此限定主张范围。
### 2.4 骨干网络与训练
一个 116.66M 参数的因果 LM 骨干(mm125 下加上库和头,总计 126.21M)在在线采样的因果世界上训练,使用标准 LM 损失加上答案头、门控和负载均衡项。所有臂共享冻结配方:40k 步,lr 6×10−46\\times 10^\{\-4\} 余弦衰减至 6×10−56\\times 10^\{\-5\},1.5k 预热,βfloor=0.3\\beta\_\{\\mathrm\{floor\}\}=0.3,Gumbel 1.0,λlb=0.01\\lambda\_\{lb\}=0.01;各臂仅在 gate\_mode 和 λg\\lambda\_\{g\} 上不同。一个参数匹配的单体 transformer(MONO,125M)作为 LM 质量基线。
## 3 实验协议
**标准优先。**每个头条主张都配有一个预注册的、机器可检查的标准,并在此标准所约束的数据之前存档(带 md5 链式脚本)。置换检验(2,000 次置换,存档种子;Pesarin & Salmaso 2010 (https://arxiv.org/html/2608.11767#bib.bib23))驱动所有互信息主张;编辑主张为通过/失败,零统计自由度。每个基于 MI 的标准都附带一个流水线验证门:无监督对照臂必须落在零假设带内(\|z\|<2\|z\|<2),该标准才可解释——这是早期流水线泄漏事件*伪造*显著性的教训(附录 B (https://arxiv.org/html/2608.11767#A2),案例 A12)所烙入协议的。
**当标准失败时。**协议预先规定接下来会发生什么:暂停受影响的主张、运行冻结诊断组,以及在适当时修订估计目标,其阈值在它所要约束的数据之前冻结。这条路径在本项目中执行过一次(§4.1 (https://arxiv.org/html/2608.11767#S4.SS1) 分支背后的 125M 流水线门失败);完整执行决策树——包括我们未重新评判的那次失误——见附录 B (https://arxiv.org/html/2608.11767#A2)(图 8 (https://arxiv.org/html/2608.11767#A2.F8))。
表 1:预注册标准与当前判定(完整存档见附录 A (https://arxiv.org/html/2608.11767#A1))。
表 2:各臂与冻结配方(除非注明,均为 125M)。所有臂:40k 步,lr 6×10−46\\times 10^\{\-4\} 余弦→6×10−5\\to 6\\times 10^\{\-5\}(预热 1.5k),βfloor=0.3\\beta\_\{\\mathrm\{floor\}\}=0.3,Gumbel 1.0,τwarmup=1500\\tau\_\{\\mathrm\{warmup\}\}=1500,λlb=0.01\\lambda\_\{lb\}=0.01;mm125 = 116.66M 骨干 + 库(总计 126.21M),N=600,6 种类型;mm25 = 22.6M,N=200,3 种类型。
**各臂与种子。**125M 下:type×6\\times 6 个种子(s0–s2 已存档;s3–s5 为 A20-R 确证性),emergent×2\\times 2(s0 已存档;s1 为 A20-R 对照),blocks×3\\times 3(s0 已存档;s1 为 A20-R 对照;s2 为 A20-R 稳健性披露成员——非标准单元),MONO×1\\times 1(LM 基线)。22.6M 下:同一臂族,N=200 / 3 种类型。
**反救援纪律。**不重新评判已存档数值,不在数据后修改阈值,不补充种子,不做第二次复现。每次协议修订都*在*其所影响的数据之前存档。本项目唯一一次修订(二元流水线检查→\\to配对归因门)遵循了这一规则,并在全文充分报告(§4.1 (https://arxiv.org/html/2608.11767#S4.SS1),附录 B (https://arxiv.org/html/2608.11767#A2))。
## 4 结果
### 4.1 移动零假设,以及类型化组织的来源(标准 S1 + 归因门)
**22.6M(已存档,最终)。**类型监督路由产生 slot×\times类型组织,跨三个种子复现:每种子 z = 4.47 / 5.99 / 7.02(每个 p≤5×10−4p\\leq 5\\times 10^\{\-4\};Stouffer z = 10.1;Stouffer 等人 1949 (https://arxiv.org/html/2608.11767#bib.bib25)),去偏 MI 超额 0.072–0.124 nats(均值 0.0998),而两个无监督臂均位于零假设上(emergent z=\+0.21,blocks z=\+0.14;T3 存档提取)。按冻结分级,判定为 PASS,中等等级:每种子 z 门槛 3/3 满足;强等级平均超额门槛(0.10)差 0.0002 未达到,并照实记录(§7 (https://arxiv.org/html/2608.11767#S7),局限性)。一个使用语义任意标签的对照条件完全无法学习(存档对照 F1,两种协议,四个种子):门控头利用的是真正的类型结构,而非标签噪声。
**125M:零假设移动了。**所有三个类型种子都通过原始幅度门槛:z = 6.09 / 7.75 / 5.62,超额 = \+0.141 / \+0.164 / \+0.134 nats(种子对齐;320 条查询,2,000 次置换)。然而,流水线验证门并未干净通过:blocks 臂测得 z=\+2.38(超额 \+0.050,p=0.012),高于 \|z\|<2\|z\|<2 零假设带,而 emergent 位于 z=\+1.09。按照预注册决策树,125M 下的 S1 被暂停,等待诊断。T相似文章
CausalGate: 因果重要性蒸馏用于Transformer模块剪枝
CausalGate引入了一种方法,通过因果干预测量Transformer子层的重要性,并将其蒸馏为静态标量门控,实现高效推理且无运行时开销,优于现有的剪枝和路由方法。
基于反事实链和因果图的LLM可解释性
本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。
罕见事件因果路径的形式化与可证伪性
本文提出了罕见事件因果路径的形式化定义,并讨论了其可检验的含义,将简单口头解释与详细因果模型联系起来。
Vernier: 探究因果推理中词汇缺口背后的表征错位
本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。
消融可逆的注意力头不转移:对Transformer中机制角色声明的压力测试
本文表明,满足机制角色声明常见标准(必要性、线性可解码性、消融可逆性)的注意力头,在跨提示词转移计算时常常失败,并引入了KID(Knowing/Intent/Doing)框架和一个三阶段流水线,用于更严格的角色分配。