为什么?解读模型对因果关系与对立关系的编码

arXiv cs.CL 论文

摘要

本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。

arXiv:2607.18570v1 公告类型:新 摘要:话语关系为文档提供结构,对语言理解至关重要,并提升语言模型的性能和伦理性。在本工作中,我们研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何编码英语中的话语关系,特别关注因果关系与对立关系这一对比性关系。我们将任务设定为下一个词元预测任务,并应用一系列可解释性技术来测试模型内部机制。我们的发现表明,某些早期层在序列中间词元上做出预测决策,而一些中层更接近最后一个词元时最终确定其决策。其余大部分层主要传播早期的决策,而非主动影响这些决策。此外,我们观察到某些层表现出对某一答案优于其他答案的偏好,这表明基于话语的推理存在非对称表示。\footnote{我们的代码可在 https://github.com/abhidipbhattacharyya/causation_vs_antithesis 获取}
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 其因何在?解读模型对因果与对比关系的编码  
来源:https://arxiv.org/html/2607.18570  
Abhidip Bhattacharyya 马萨诸塞大学阿默斯特分校 abhidipbhatt@umass\.edu  
Shira Wein 南佛罗里达大学 shirawein@usf\.edu  

###### 摘要  

篇章关系为文档提供结构,对语言理解至关重要,并有助于提升语言模型的性能和伦理性。在本工作中,我们研究指令微调的Transformer模型(LLaMA和Mistral)如何编码英语中的篇章关系,特别关注因果与对比这两种对立关系。我们将任务设定为下一个词元预测任务,并应用一套可解释性技术来探测模型内部机制。我们的发现表明,某些早期层在序列中间词元处做出预测决策,而一些中间层则在接近最后一个词元时才最终确定决策。其余大部分层主要传播早期决策,而非主动影响它们。此外,我们观察到某些层对某一答案表现出偏好,而非等量齐观,这表明基于篇章的推理存在非对称表示。¹¹我们的代码可在 https://github.com/abhidipbhattacharyya/causation_vs_antithesis 获取。

# 其因何在?解读模型对因果与对比关系的编码

Abhidip Bhattacharyya 马萨诸塞大学阿默斯特分校 abhidipbhatt@umass\.edu  
Shira Wein 南佛罗里达大学 shirawein@usf\.edu  

## 1 引言  

篇章关系对自然语言理解至关重要,它刻画了文档中句子的结构。此外,篇章结构是使语言模型与人类偏好对齐并促进伦理行为的关键组成部分(Harrison 等,2019 (https://arxiv.org/html/2607.18570#bib.bib57);Hüsünbeyi 等,2022 (https://arxiv.org/html/2607.18570#bib.bib56);Adewoyin 等,2022 (https://arxiv.org/html/2607.18570#bib.bib58);Kim 等,2026 (https://arxiv.org/html/2607.18570#bib.bib54);Nakshatri 等,2025 (https://arxiv.org/html/2607.18570#bib.bib55))。然而,先前关于Transformer中篇章编码的研究有限,仅有最近的一项工作利用Transformer电路发现来识别“篇章电路”(Miao and Kan,2025 (https://arxiv.org/html/2607.18570#bib.bib49))。

因果:约翰努力学习,所以他通过了考试。  
对比:约翰努力学习,但他考试却不及格。  
(a) 说明因果和对比关系的例子。因果将行动与其预期结果联系起来,而对比则呈现相反的结果。  
因果:约翰努力学习,所以他能通过考试。  
对比:约翰努力学习,但他未能通过考试。  
(b) 同样的例子,通过“能”与“未能”的词汇对比进行改写。连词“所以”表示因果,而“但”则表示对比关系。除了四个高亮词元外,两个句子完全相同。  

在本工作中,我们研究Transformer对英语中两个常见且对立的关系——因果与对比——的编码。在修辞结构理论(RST;Mann and Thompson,1987 (https://arxiv.org/html/2607.18570#bib.bib14);Mann 等,1989 (https://arxiv.org/html/2607.18570#bib.bib15))中,因果表示行动与其后果之间的关系。相比之下,对比这种修辞手法使用平行的语法结构来并置相反或对立的思想。图1(a) (https://arxiv.org/html/2607.18570#S1.F1.sf1) 展示了这些篇章关系的示例。在我们对Transformer模型中篇章编码的研究中,我们的研究问题包括:

- RQ1. 哪些词元级特征驱动模型在对比与因果之间做出决策?
- RQ2. 哪些层在识别对比与因果中发挥关键作用?
- RQ3. 哪些关键概念帮助模型区分对比与因果?
- RQ4. 篇章信息如何在模型各层之间传播?

为了回答这些研究问题,像 Miao 和 Kan(2025 (https://arxiv.org/html/2607.18570#bib.bib49))一样,我们将任务表述为下一个词元预测任务,其中词元指示句子中识别出的因果或对比关系。我们进行一系列因果干预,并应用自动化电路发现技术。我们的结果表明,早期和中间层编码由话语标记(如“所以”/“但”)指示的局部关系意义,而高层层主要传播或细化这些信号。相比之下,对最后一个词元的干预表明,较低层整合句子意义,而较高层做出并维持最终决策。我们还观察到某些层对其中一个选项存在固有偏好。在电路层面,我们发现一组稳定的核心连接,它们持续驱动决策制定和信息流动,尽管具体涉及的边可能因动词类型和示范数量而异。我们的发现揭示了关键篇章关系如何在Transformer模型中被编码,从而有助于提升模型性能并与人类偏好对齐。

## 2 方法与实验  

在本节中,我们详细说明任务形式(第2.1节 (https://arxiv.org/html/2607.18570#S2.SS1))、数据准备程序(第2.2节 (https://arxiv.org/html/2607.18570#S2.SS2))、模型配置(第2.3节 (https://arxiv.org/html/2607.18570#S2.SS3))和可解释性技术(第2.4节 (https://arxiv.org/html/2607.18570#S2.SS4))。

### 2.1 任务  

我们提示模型以指示句子中因果或对比的方式完成答案。为了限制模型预测空间,我们将答案设计为“能”或“未能”。我们专注于仅解码器模型,即LLaMA 3(Dubey 等,2024 (https://arxiv.org/html/2607.18570#bib.bib12))和Mistral(Jiang 等,2023 (https://arxiv.org/html/2607.18570#bib.bib13)),使用它们的70亿参数指令微调变体。任务被表述为下一个词元预测问题,使我们能够探究这些模型内部如何表示和区分不同的篇章关系。

我们将区分因果与对比的任务表述为下一个词元预测问题。在我们的设置中,每个句子都包含“能”或“未能”。例如,图1(a) (https://arxiv.org/html/2607.18570#S1.F1.sf1) 中所示的句子被重新表述为图1(b) (https://arxiv.org/html/2607.18570#S1.F1.sf2) 所示。

为了向LLM提示此任务,我们将“能”或“未能”替换为空白,并要求模型预测缺失的词,指令其仅选择“能”或“未能”。提示包括少量示例(每类两个)以阐明任务。我们最初尝试了1到6次提示,发现4次提示产生的结果更一致。因此,本文中的实验采用4次提示(每类两个)。然而,后续实验表明,0次提示取得了最佳总体性能。图11 (https://arxiv.org/html/2607.18570#A1.F11) 在附录A (https://arxiv.org/html/2607.18570#A1) 中展示了不同示范数量下的预测准确率,示例提示如图2 (https://arxiv.org/html/2607.18570#S2.F2) 所示。提示设计的其他细节见附录A (https://arxiv.org/html/2607.18570#A1)。

用户提示:  
1. 句子:约翰今早赶上了火车,所以他____准时到达。  
答案:能  
2. 句子:团队练习了一整周,所以他们____表现出色。  
答案:能  
3. 句子:团队练习了一整周,但他们____表现出色。  
答案:未能  
4. 句子:莉娜努力学习,但她____通过考试。  
答案:未能  
现在完成以下内容:  
5. 句子:他昨晚睡得很好,但他今天早上____跑步。  
答案:  

图2:我们少量提示的示例。系统提示可在附录A (https://arxiv.org/html/2607.18570#A1) 的图10 (https://arxiv.org/html/2607.18570#A1.F10) 中找到。

### 2.2 数据  

为了探究模型对因果和对比的表示,我们构建了一个小型数据集,包含含有对比及其对应因果关系的句子对。我们施加了一个约束:每对中的两个句子必须具有相同的词数。这个约束是出于我们计划进行的因果干预实验(第2.4节 (https://arxiv.org/html/2607.18570#S2.SS4))的需要。

为了生成数据集,我们提示ChatGPT 4o²² 访问时间:2025年5月。,首先手动创建几个示例对,说明因果与对比之间的对比。这些示例随后被用来提示ChatGPT按照相同模式生成额外的句子对。我们生成了130个这样的样本,用于训练探针。此外,我们创建了30个样本作为测试集,并由作者手动检查以确保它们符合所需格式。

在初始设置中,“所以”提示“能”表示因果,而“但”提示“未能”表示对比。为了使任务更具挑战性,我们在卫星从句中引入了否定动词,这逆转了“能”和“未能”之间的关联(图3 (https://arxiv.org/html/2607.18570#S2.F3))。对于这类动词,“未能”通常适合因果语境,而“能”更适用于对比语境。这防止了模型仅依赖提示词“所以”或“但”来区分因果与对比。我们怀疑动词的情感会影响模型预测“能”或“未能”的能力。例如,在图1(b) (https://arxiv.org/html/2607.18570#S1.F1.sf2) 中,动词意义是正面的,而在图3 (https://arxiv.org/html/2607.18570#S2.F3) 中,动词意义是负面的。

因果:她违反规则,所以她未能加入团队。  
对比:她违反规则,但她能加入团队。  

图3:一个示例,说明如何使用“未能”和“能”来区分因果与对比。注意,在图1(b) (https://arxiv.org/html/2607.18570#S1.F1.sf2) 中,“能”出现在因果示例中,而“未能”用于对比。这个示例展示了相反的使用方式,突出了动词语义如何影响解释。此外,动词语义可能在显式否定下发生转变。因此,对于每种情况,我们还生成了包含显式否定的示例。引入否定通常会逆转因果和对比两种情况下“能”和“未能”的使用。例如,图3 (https://arxiv.org/html/2607.18570#S2.F3) 中的示例在图4 (https://arxiv.org/html/2607.18570#S2.F4) 中,当在卫星从句中引入“不”时,角色发生了翻转。然后我们检查模型在这些否定示例上的性能。

因果:她没有违反规则,所以她能加入团队。  
对比:她没有违反规则,但她未能加入团队。  

图4:一个示例,展示了当卫星动词被否定时,“能”和“未能”如何互换角色。示例对应图3 (https://arxiv.org/html/2607.18570#S2.F3) 及其否定形式。

### 2.3 模型  

我们提示两个大小相当且来自同一架构家族的大语言模型,以观察共同模式。我们的主要研究模型是LLaMA(Dubey 等,2024 (https://arxiv.org/html/2607.18570#bib.bib12)),具体是LLaMA-3-8B-Instruct,它是LLaMA的指令微调版本,拥有80亿参数、32层和32个注意力头(AI@Meta,2024 (https://arxiv.org/html/2607.18570#bib.bib16))。LLaMA使用分组查询注意力,有8个键值组。我们使用Mistral作为第二个模型(Jiang 等,2023 (https://arxiv.org/html/2607.18570#bib.bib13)),具体是Mistral-7B-Instruct-v0.2(mistralai,2024 (https://arxiv.org/html/2607.18570#bib.bib17)),是Mistral的指令微调版本。与LLaMA类似,Mistral有32层和32个注意力头。然而,Mistral采用滑动窗口注意力(Beltagy 等,2020 (https://arxiv.org/html/2607.18570#bib.bib18);Zaheer 等,2020 (https://arxiv.org/html/2607.18570#bib.bib19))。

我们选择指令微调模型,因为我们在实验流程中使用了建模提示。先前的研究表明,指令微调确实会改变LLM的行为,例如通过改变自注意力头使其更多地关注提示中常见动词而不是普通动词(Wu 等,2024 (https://arxiv.org/html/2607.18570#bib.bib8)),这使得我们的发现如何推广到其他基础模型尚不清楚。

参照图注 (a)  
参照图注 (b)  

图5:LLaMA中跨示例词元的归一化SHAP贡献。子图(a)和(b)展示了单个句子的示例级SHAP值。  
参照图注 (a)  
参照图注 (b)  
参照图注 (c)  
参照图注 (d)  

图6:LLaMA中跨示例词元的归一化SHAP贡献。第一行展示包含话语标记“但”的句子结果,第二行展示包含“所以”的句子结果。子图(a)和(c)展示了正面动词的归一化平均SHAP值,而子图(b)和(d)展示了负面动词的归一化平均SHAP值。

### 2.4 可解释性方法  

为了回答我们的研究问题,我们基于机械可解释性构建了几种技术。我们操作化的第一种可解释性技术是激活修补(Geiger 等,2021 (https://arxiv.org/html/2607.18570#bib.bib25);Meng 等,2022 (https://arxiv.org/html/2607.18570#bib.bib23);Zhang and Nanda,2024 (https://arxiv.org/html/2607.18570#bib.bib24)),这是一种用于理解特定内部表示对模型预测的因果影响的技术。在这种方法中,模型内部表示的一部分被替换为模型处理替代输入时生成的表示。然后通过分析输出logits(即模型对每个可能输出词元的未归一化得分)的相应变化来评估目标单元的因果作用。如果替换表示使logits或probits偏向不同输出,则表明被检查单元在模型预测中起到了因果作用。

在我们的激活修补方法中,我们首先在数据实例x_base(对比或因果)上运行模型,并测量两个答案选项“能”与“未能”之间的logit差异,记为LD(x_base)。其次,我们在相应的反例x_source上运行模型。反例是通过切换“所以”/“但”,或否定卫星从句中的动词来创建的。因此,对比的反例将是因果,反之亦然。然后我们测量两个答案选项之间的logit差异,记为LD(x_source)。接下来,我们在x_base上运行模型,但对于目标层和词元位置,我们将激活(h_l,t)替换为来自x_source运行的相应激活。我们像以前一样测量logit差异,记为LD(x_base; h_l,t_base ← h_l,t_source)。按照先前的工作(Wang 等,2023 (https://arxiv.org/html/2607.18570#bib.bib27);Li 等,2025 (https://arxiv.org/html/2607.18570#bib.bib2

相似文章

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。