测试,然后路由:语言模型如何跨模型和语言执行上下文中的条件规则

arXiv cs.CL 论文

摘要

本文通过探测测试和路由是否是可分离的机制,研究语言模型如何执行上下文中的条件规则。利用跨三个开放模型和六种语言的激活修补,作者发现谓词测试是模块化的,而路由表示则受令牌绑定且不可迁移。

arXiv:2608.04183v1 公告类型:新 摘要:当语言模型遵循上下文中的条件规则(如“如果P(x)则A否则B”)时,它是否会组装一个运行时电路,其中一个模块测试谓词,另一个模块路由答案?我们通过激活修补在四供体设计下探究了这一点,其中两个交换规则的供体使条件和答案词不一致,因此每一层都揭示它携带的是两者中的哪一个。在来自两个家族的三款开放模型和共享一个固定项目库的六种语言中,堆栈中部的残差带携带谓词的真值:修补它会重路由答案,谓词结果翻转接近1.0,映射翻转接近0.0,在18个单元中的17个满足严格的预先指定隔离标准,并且相同的定位在五个谓词家族中保持。路由器则呈现相反的轮廓。一个学习到的子空间在训练对内近乎完美地翻转A和B,但在每个模型中迁移到新对时约为0,而在Gemma-3-4B(唯一被跨语言探测的模型)中,它迁移到其他语言中的同一对时约为0.98。在我们运行的所有探测下,路由方向是令牌绑定且不可迁移的(在Gemma中主要是答案读出,在Qwen中是特定于对的),而不是抽象的路由模块。测试是模块化的;在这些探测下,路由则不然。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:45

# 语言模型如何跨模型和语言执行上下文条件规则
来源:https://arxiv.org/html/2608.04183
Luxshan Thavarasa1, Sivasuthan Sukumar2 1独立研究者,科伦坡,斯里兰卡 2莫拉图瓦大学计算机科学与工程系,斯里兰卡 luxshanlux2000@gmail\.com, sivasuthan\.26@cse\.mrt\.ac\.lk

###### 摘要

当语言模型遵循一条上下文条件规则(例如“如果\(P(x)\)那么\(A\)否则\(B\)”)时,它是否会组装一个运行时电路,其中一个模块*测试*谓词,另一个模块*路由*答案?我们使用激活修补(activation patching)在四供体设计下对此进行探测,其中两个交换规则供体使得条件和答案词*不一致*,因此每一层都会揭示它携带的是两者中的哪一个。在来自两个家族的三个开源模型以及共享同一固定题库的六种语言中,一个中段残差带携带谓词的真值:修补它会以接近\(1.0\)的谓词结果翻转和接近\(0.0\)的映射翻转来重新路由答案,在18个单元中的17个中满足严格的预指定隔离标准,并且相同的定位在五个谓词家族中成立。路由器则表现出相反的轮廓。一个学习到的子空间在训练对内部近乎完美地翻转\(A \leftrightarrow B\),但在每个模型中转移到新对时约为\(0\),而在Gemma-3-4B(唯一跨语言探测的模型)中,它以约\(0.98\)的比率转移到其他语言中的*相同*对。在我们运行的每一次探测中,路由器方向都是绑定到令牌且不可转移的(在Gemma中主要是答案读出,在Qwen中是对特定的),而不是一个抽象的路由模块。测试是模块化的;在这些探测下,路由不是。

测试,然后路由:语言模型如何跨模型和语言执行上下文条件规则

Luxshan Thavarasa1, Sivasuthan Sukumar2
1独立研究者,科伦坡,斯里兰卡
2莫拉图瓦大学计算机科学与工程系,斯里兰卡
luxshanlux2000@gmail\.com, sivasuthan\.26@cse\.mrt\.ac\.lk

## 1 引言

给定一条上下文条件规则(“如果\(P(x)\)那么\(A\)否则\(B\)”),大型语言模型要回答查询必须做两件事:*测试*谓词\(P(x)\)是否成立,以及*路由*适当的答案\(A\)或\(B\)到输出。模型是将这些作为可分离的部分组装,还是将测试和路由纠缠在一个不可分割的机制中,这是关于上下文规则如何执行的一个基本问题,而行为评估无法回答这个问题:正确的补全与两种组织方式都一致。

迄今为止,大多数已刻画的机制电路是*权重存储*的:为固定任务预训练、可复用的机制,例如间接宾语识别电路(Wang et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib34))或归纳头(Olsson et al., 2022 (https://arxiv.org/html/2608.04183#bib.bib23))。条件规则则不同:其文本、谓词和答案映射都是在推理时提供的,并且随提示而变化,因此任何执行该规则的电路都必须在*运行时*组装。这使我们的研究对象与函数向量和任务向量(Todd et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib31); Hendel et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib13))以及过滤器头(Sharma et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib26))并列,但将问题从*上下文内表示的是什么内容*转移到*一个两部分条件计算如何在残差流中被分解*。部署的提示中充斥着这样的条件逻辑(护栏、工具路由、条件策略;附录B (https://arxiv.org/html/2608.04183#A2)),而哪一半是模块化的,决定了什么可以被审计并以可移植的方式被引导。

我们研究一个规范规则(“如果数字大于5,输出dog,否则输出cat”),并附带八个演示和一个数字查询,模型补全其单令牌答案。我们的核心做法是一组四个供体提示(图2 (https://arxiv.org/html/2608.04183#S3.F2)),通过激活修补,*逐层*读出残差流位点携带的是谓词的真值*条件*还是被路由的*答案*词。两个关键供体使条件和答案*不一致*:映射供体(map-donor)在保持谓词为真的同时交换规则的答案映射;映射空供体(map-null)在保持谓词为假的同时这样做。跟随真值的层持有条件;跟随答案词的层持有读出。这揭示了一个清晰的分界(图3 (https://arxiv.org/html/2608.04183#S4.F3)):一个中段测试阶段,其中修补跟随条件,以及一个较晚的路由阶段,其中修补跟随答案。

应用这一方法,我们发现了一个明显的不对称性。谓词测试是一个因果上可分离、可定位的模块:修补单个中段带通过仅翻转谓词的真值来翻转答案。在我们运行的每一次探测中,参数路由都没有表现出可分离、可转移的子空间:看似路由答案的方向翻转一个标签对,但不能转移到另一个。*测试是模块化的;在这些探测下,路由则不是。*

我们的贡献是条件与答案不一致设计本身(图2 (https://arxiv.org/html/2608.04183#S3.F2)、图3 (https://arxiv.org/html/2608.04183#S4.F3)),作为一个共享题库的多语言协议运行:一个固定的题库完全以六种语言中的每一种呈现,只有数字和答案令牌保持固定。应用它产生了:一个可分离的谓词测试带,在两个标签对、一个三输出变体和多令牌答案上定位,并在来自两个家族的三个模型、六种语言和五个谓词上复现;以及一个不可分离的路由:一个学习到的子空间(分布式对齐搜索,DAS)带有一个转移对照,在每个模型中翻转训练标签对,却不能转移到新的对(在Gemma-3-4B中它确实跨语言转移),一个绑定到令牌的读出方向而不是可复用的路由器;没有转移对照,对内交换精度\(1.00\)会在所有三个模型中证明一个虚假的路由器。与权重存储的IOI电路的探索性对比见附录C (https://arxiv.org/html/2608.04183#A3)。代码、数据和逐单元结果将发布。111https://github.com/Luxshan2000/icl-conditional-circuits

## 2 相关工作

#### 电路与激活修补。

机制可解释性工作通过因果干预将行为定位到注意力头和MLP的稀疏子图上:间接宾语识别为读取任务特定电路设定了模板(Wang et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib34)),基于激活和路径的修补提供了因果中介机制(Meng et al., 2022 (https://arxiv.org/html/2608.04183#bib.bib20); Goldowsky-Dill et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib10); Vig et al., 2020 (https://arxiv.org/html/2608.04183#bib.bib33)),并且电路可以跨任务复用(Merullo et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib21))。这些电路主要是*权重存储*的:提示只是激活了预训练的结构。上下文任务中的阶段结构也正在显现:一个通用的中段请求→执行分离(Variengien and Winsor, 2025 (https://arxiv.org/html/2608.04183#bib.bib32))以及用于上下文命题推理的模块化子电路(Hong et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib14); Kim et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib15); Chen et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib3))。我们在使条件和答案不一致的供体下分解一个上下文*条件*(谓词评估与带有显式else分支的答案路由)。

#### 作为向量、子空间和函数的上下文学习。

一个互补的传统将上下文任务压缩成可移植的表示:函数向量和任务向量将演示的映射总结为单个可移植的激活(Todd et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib31); Hendel et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib13)),随后有关于其泛化、过滤器式选择头、概念子空间和算法原语的工作(Ye et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib39); Sharma et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib26); Tang et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib28); Lippl et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib17))。这一文献问的是*应用了什么映射*;我们问的是条件规则如何*分解*为谓词测试和参数路由,并发现在我们的探测下路由不接受可分离、可转移的子空间。可移植的过滤器头谓词(Sharma et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib26))独立支持测试可分离性;该设置没有else分支或路由分析,而不对称性正是在那里。

#### 变量绑定与路由。

模型如何将实体绑定到角色并将值路由到槽位,是Transformer中符号式计算的核心(Feng and Steinhardt, 2024 (https://arxiv.org/html/2608.04183#bib.bib7); Wu et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib36)),并有关于因果探针绑定的要求(Davies et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib5))以及模型为单一行为混合不同机制的证据(Gur-Arieh et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib11))。在这个意义上,我们的任务是一个路由问题,但不一致供体逐层暴露了一个带是持有条件还是答案词:一个测试/路由阶段边界,而不是单个绑定操作。

#### 引导、可解码性与多语言机制。

方向性干预可以引导行为,甚至是有条件地引导(Lee et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib16); Arditi et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib1)),然而可解码或可引导的方向不一定是因果上可分离、不变的机制(Nadaf, 2026 (https://arxiv.org/html/2608.04183#bib.bib22); Opiełka et al., 2026 (https://arxiv.org/html/2608.04183#bib.bib24)),并且仅靠交换成功是弱的证据:优化找到的子空间可以传递它同时是虚幻的,即使在随机初始化的模型上也是如此(Makelov et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib18); Sutter et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib27)),并发工作通过转移对头级声明进行了压力测试(Quirke, 2026 (https://arxiv.org/html/2608.04183#bib.bib25))。另外,多语言分析发现计算通过一个共享的、主要是英语中心的内部空间进行路由(Wendler et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib35); Zhao et al., 2024 (https://arxiv.org/html/2608.04183#bib.bib41)),跨语言修补将概念与语言分离(Dumas et al., 2025 (https://arxiv.org/html/2608.04183#bib.bib6)),并且在两种语言中电路几乎相同(Ferrando and Costa-jussà, 2024 (https://arxiv.org/html/2608.04183#bib.bib8))。我们的转移对照区分了真正的路由子空间和答案读出:一个学习到的路由方向翻转一个标签对但不能转移到另一个,这与读出纠缠在一起,而不是可分离的。我们的测试带在六种语言和四种文字(包括Tamil和Sinhala,据我们所知,这两种语言对机制定位是新的)的中段重复出现,并且在Gemma-3-4B中,固定对的读出方向是语言不变的(§4.2 (https://arxiv.org/html/2608.04183#S4.SS2))。

## 3 方法

### 3.1 任务与数据集

我们研究形式为“如果\(P(x)\)那么\(A\)否则\(B\)”的上下文条件规则。规范的英语规则是*“Rule: if the number is greater than 5, output dog, otherwise output cat.”*每个提示连接规则、八个上下文数字/输出演示和一个查询数字;模型补全一个答案令牌。谓词为\(P(x) \equiv (x > 5)\),答案标签\(A=\text{\emph{dog}}\),\(B=\text{\emph{cat}}\)是单令牌。

所有实验都从*一个*固定的规范题库中提取250个条目,每个实验单元(每个模型和每种语言)共享该题库,因此任何跨单元比较都不会因不同的随机样本而混淆。六种语言(en, zh, hi, id, ta, si)从该题库中*完整*呈现(规则和演示支架都一样),而数字和答案标签*dog*/*cat*保持拉丁字母和单令牌形式,因此跨语言的分词差异落在提示文本上,但绝不落在被测量的答案上(附录A (https://arxiv.org/html/2608.04183#A1)详述了翻译协议):操作目标是规则和支架理解,同时保持读出接口不变。这些语言跨越四种文字和广泛的资源范围(Tamil和Sinhala是机制定位的新对象)。每个单元还在第二个单令牌对(*fox*/*owl*)下呈现;网格曲线汇集两个对。替代谓词族(数字阈值\(t \in \{3,5,7\}\)、集合成员、元音开头)位于一个单独的仅英语题库中,用于谓词泛化实验。

### 3.2 激活修补与指标

我们使用激活修补(Vig et al., 2020 (https://arxiv.org/html/2608.04183#bib.bib33); Meng et al., 2022 (https://arxiv.org/html/2608.04183#bib.bib20); Goldowsky-Dill et al., 2023 (https://arxiv.org/html/2608.04183#bib.bib10))来定位计算:在*基础*提示和供体提示上运行模型,将供体在单层最后令牌位置的残差流向量复制到基础运行中,并测量预测答案是否改变;逐层重复,这定位了哪个带携带计算的哪一部分。

我们报告两个指标(Zhang and Nanda, 2024 (https://arxiv.org/html/2608.04183#bib.bib40); Heimersheim and Nanda, 2024 (https://arxiv.org/html/2608.04183#bib.bib12))。第一个是\{A,B\}上的双向*翻转概率*,由标签质量门控:只有当\{A,B\}上的组合概率质量至少为\(0.30\)时,修补才算翻转,因此破坏性折叠分布的修补不会计为翻转。第二个是渐变的*摆动比例*恢复

\(R = \frac{\mathrm{LD}_{\text{patched}}-\mathrm{LD}_{\text{base}}}{\mathrm{LD}_{\text{donor}}-\mathrm{LD}_{\text{base}}}\),其中\(\mathrm{LD}=\mathrm{logit}(A)-\mathrm{logit}(B)\):修补将基础对数几率差移向供体的程度(\(R=0\)无移动,\(R=1\)完全恢复)。当这个摆动比例是为修补的头部组或子空间而不是整层残差修补计算时,我们将其写为\(\Phi\)。两个翻转方向总是运行(谓词真→翻转和假→翻转);图1 (https://arxiv.org/html/2608.04183#S3.F1)说明了这一操作。

参见说明图1:修补操作。供体的最后令牌残差\(h_\ell\)在层\(\ell\)被复制到基础运行中。然后我们记录每一层的修补答案是否翻转(在标签质量门控下,\(\geq 0.30\))以及渐变的摆动比例恢复\(R\)。

### 3.3 四个供体

对于每个基础条目(谓词真,答案A=*dog*),我们通过交叉规则*映射*(标准与交换)和查询*结果*(真与假)来构造四个提示,如图2 (https://arxiv.org/html/2608.04183#S3.F2)所示:

- •基础:标准规则,查询真⇒谓词真,答案*dog*(参考

相似文章

信念与现实分离存在于语言模型中对共享值槽的路由中

arXiv cs.CL

本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。