当可解码性不足时:语言模型中的逻辑有效性表示、行为分离与因果测试

arXiv cs.CL 论文

摘要

本文研究了大型语言模型如何内部表示逻辑有效性,表明尽管行为表现不佳,有效性信息仍可从隐藏状态中解码,这表明表示、表达和因果使用具有不同的作用。

arXiv:2609.02438v1 公告类型:新 摘要:大型语言模型可能看起来能够进行逻辑推理,但仅凭正确或错误的答案并不能告诉我们模型内部表示了什么。我们使用匹配的有效-无效前提-结论对,在五个开源 Transformer 模型中研究逻辑验证,这些对在推理家族、语义域、模板和难度级别上有所不同。尽管行为表现接近随机,逻辑有效性通常几乎可以从隐藏状态中完美解码,并且在保留的模板、域和推理家族中仍然高度可解码。在正确性条件评估明确的情况下,有效性在行为错误的示例上也保持高度可解码。与此同时,详尽的留一测试揭示了这种泛化的明确限制,并且沿着探针导出的有效性方向的干预与随机控制相比只有微弱、非特异性的效果。我们的结果表明,表示有效性、在行为中表达它以及因果使用它是不同的。有效性相关信息可以从模型的隐藏状态中强烈解码,而不会在输出中可靠地表达。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:54

# 当可解码性不足时:语言模型中的逻辑有效性表征、行为分离与因果检验  
来源:https://arxiv.org/html/2609.02438  
Smitha Muthya Sudheendra, Jaideep Srivastava  
所属机构:明尼苏达大学双城分校  
联系邮箱:[srivasta@umn\.edu](mailto:)  

###### 摘要  
大型语言模型可能展现出逻辑推理的能力,但仅有正确或错误的答案并不能揭示模型内部的表征机制。本研究通过匹配的有效-无效前提-主张对(涵盖不同推理家族、语义域、模板和难度层级),在五个开源 Transformer 模型中探究逻辑验证行为。尽管模型在行为层面的表现接近随机,但其隐状态中逻辑有效性往往几乎可以被完美解码,并且在保留模板、语义域和推理家族的条件下仍保持较强的可解码性。在正确性条件评估定义明确的场景中,即使对行为错误的样本,有效性仍能被高度解码。与此同时,详尽的留一测试揭示了这种泛化的明确局限,且基于探针推导的有效性方向所进行的干预,相较于随机控制组仅产生微弱且非特异性的效果。结果表明,有效性的表征、行为表达和因果使用是三个不同的层面。有效性相关信息可以在不被模型输出可靠表达的情况下,从其隐状态中被强烈解码。  

## 1 引言  
大型语言模型常在需要推理的任务上进行评估,但仅凭行为成功并不能揭示答案背后的内部计算过程。正确的预测可能反映了相关的逻辑关系,但也可能源于词汇或语义规律。同样,错误的预测并不一定意味着模型隐状态中缺乏正确决策所需的信息。因此,区分模型的输出与其表征内容,以及这些表征如何被使用,是可解释性研究的核心。  
我们通过*逻辑验证*来研究这一区别:给定一组前提和一个候选主张,模型必须判断该主张是否成立。这一设置很有价值,因为有效性由前提与主张之间的关系定义,且金标准标签可以被确定性地分配。因此,它支持在改变表面形式、语义内容和推理结构时进行有效的有效-无效对比控制。  
我们分离出三个问题:模型是否表达了正确的有效性判断;有效性相关信息是否在其隐状态中线性可及;以及基于探针推导的方向是否因果影响最终决策。为此,我们构建了 800 个样本,组织为 400 个匹配的有效-无效对,涵盖五个推理家族、五个语义域和三个难度层级。我们使用行为似然性和逐层线性探针评估五个开源 Transformer 模型,测试对保留模板、域和推理家族的泛化能力,并使用匹配对、正确性条件、词汇、元数据和洗牌标签控制。对于其中三个模型,我们还沿探针推导的有效性方向进行干预,并将其效果与归一化匹配的随机方向进行比较。  
行为验证在所有五个模型中保持或接近随机水平,通常伴有强烈的答案标签偏好。隐状态则呈现出不同的景象:有效性在分布内几乎可以被线性完美解码,并在保留模板和许多域与推理家族偏移下仍保持强可解码性。然而,详尽的留一评估揭示了明确的例外情况,包括未能泛化到未见的三段论推理。因此,泛化是广泛但不均匀的。  
这种分离在行为错误的情况下同样存在。在正确性条件评估定义明确的情况下,有效性在错误回答的样本上仍保持高度可解码。在所有主要分割中,探针还保持了匹配对中有效与无效成员之间的顺序,即使全局校准发生偏移。因此,行为错误通常与线性可及有效性信息的缺失并不一致。  
然而,高可解码性并不意味着简单的因果控制。沿探针推导方向的干预仅在输出边际上产生微小且不一致的变化,与随机正交控制相当或更小。因此,分离有效与无效样本的线性方向本身并不是验证行为的强控制变量。  
综上所述,研究结果区分了行为表达 ≠ 表征可及性 ≠ 因果使用。\text{行为}\ \text{表达}\;\neq\;\text{表征}\ \text{可及性}\;\neq\;\text{因果}\ \text{使用}。我们在受控的逻辑验证设置中研究这种分离,测试有效性可解码性的泛化程度,以及在模型错误回答时是否持续存在。更广泛地说,结果主张在研究语言模型推理时,应将行为表现、可解码性和因果影响视为不同的证据形式。  

## 2 相关工作  
#### 推理与逻辑评估  
行为基准如 BIG-Bench、HELM 和 BIG-Bench Hard 记录了语言模型推理的显著进展,同时也揭示了对任务表述和提示的强敏感性\[14 (https://arxiv.org/html/2609.02438#bib.bib1),7 (https://arxiv.org/html/2609.02438#bib.bib2),15 (https://arxiv.org/html/2609.02438#bib.bib3)\]。更具针对性的基准,包括 FOLIO、PrOntoQA-OOD、LogicBench 和 Multi-LogiEval,评估了演绎推理和跨逻辑结构及分布偏移的系统泛化能力\[3 (https://arxiv.org/html/2609.02438#bib.bib7),13 (https://arxiv.org/html/2609.02438#bib.bib8),10 (https://arxiv.org/html/2609.02438#bib.bib9),11 (https://arxiv.org/html/2609.02438#bib.bib10)\]。提示方法如思维链可以改善可观测的推理行为\[17 (https://arxiv.org/html/2609.02438#bib.bib4),5 (https://arxiv.org/html/2609.02438#bib.bib5)\],但生成的解释不一定能忠实地反映产生答案的计算过程\[16 (https://arxiv.org/html/2609.02438#bib.bib6)\]。因此,我们的关注点更窄:我们将验证研究为前提与候选主张之间的受控关系,并区分输出行为与内部表征。  
#### 真值与有效性的内部表征  
先前工作表明,高级变量(如事实真值)可以从语言模型激活中恢复\[2 (https://arxiv.org/html/2609.02438#bib.bib11),8 (https://arxiv.org/html/2609.02438#bib.bib12)\],而表征工程研究此类方向是否也可被操纵\[18 (https://arxiv.org/html/2609.02438#bib.bib13)\]。逻辑有效性相关但不同:它依赖于前提与结论之间的关系,而不仅仅依赖于结论本身的真值。我们的匹配对构造旨在分离这种关系属性。\[Bertolazzi 等人 \[1\]](https://arxiv.org/html/2609.02438#bib.bib18) 表明,逻辑有效性和语义合理性在线性表征于三段论推理中,并可通过激活引导进行因果影响。我们则提问:有效性可解码性在多大程度上泛化到表面形式、语义域和推理结构之外?当模型的行为判断错误时,有效性是否仍然可及?  
#### 探针与因果解释  
高探针准确率并不意味着解码的特征被模型使用。探针性能可能反映干扰变量或任务格式工件,最近的研究表明,在控制此类混淆因素后,看似强的推理相关可分性可能消失\[12 (https://arxiv.org/html/2609.02438#bib.bib17)\]。因此,我们使用匹配的有效-无效对、保留的模板/域/家族评估、洗牌标签控制和仅元数据基线。在全文中,我们将探针 AUC 解释为线性可及性的证据,而非抽象推理机制的证据。  
机制可解释性进一步促使测试解码的结构是否具有行为后果。先前工作通过探针和干预在 Othello-GPT 和多步推理等设置中恢复了内部状态变量\[6 (https://arxiv.org/html/2609.02438#bib.bib14),9 (https://arxiv.org/html/2609.02438#bib.bib15),4 (https://arxiv.org/html/2609.02438#bib.bib16)\]。我们同样将逐层探针与沿探针推导有效性方向的激活干预相结合,并将其与归一化匹配的随机控制进行比较。我们不仅问逻辑有效性是否可以从隐状态中解码,还问该表征有多大意义。它是否泛化到用于训练探针的条件之外?当模型给出错误答案时它是否仍然存在?以及干预相应方向是否会实际改变模型的行为?这些问题让我们能够分离模型内部*表征*的内容、在输出中*表达*的内容以及在决策中因果*使用*的内容。  

## 3 受控验证数据集  
我们构建了一个受控数据集来研究语言模型如何表征逻辑有效性。数据集并非旨在广泛的基准覆盖,而是旨在分离验证过程与事实回忆、搜索和解释生成等干扰因素。每个样本由一组前提和一个候选主张组成,模型必须判断主张是否从前提中得出。因为有效性取决于前提与主张之间的关系,此设置允许我们研究关系信息,而不仅仅是主张的合理性。  
### 3.1 任务与数据集结构  
每个样本表示为 \(x_i=(P_i, c_i, y_i, f_i, d_i, t_i, \delta_i)\),其中 \(P_i\) 是前提集,\(c_i\) 是候选主张,\(y_i \in \{0,1\}\) 是有效性标签。其余变量分别表示推理家族、语义域、模板家族和难度层级。模型选择“有效”或“无效”。  
数据集包含五个推理家族:三段论、传递性、集合包含、因果链和许可逻辑,实例化于五个域:虚拟、空间、社会、生物和法律-政策。在不同域中使用相同的推理结构使我们能够测试有效性表征是否依赖于特定语义内容。  
我们还定义了三个难度层级:  
- • 难度 1:直接单步验证;  
- • 难度 2:两步推理链;  
- • 难度 3:带有无关干扰前提的两步链。  
这些层级在保持输出任务不变的情况下,变化了所需的关系统合程度。  
### 3.2 匹配的有效-无效对  
数据集组织为匹配的有效-无效对。在每对内,前提、推理家族、域、模板家族和难度保持固定;仅候选主张改变。对于匹配对 \((x_i^+, x_i^-)\),  
\(P_i^+ = P_i^-,\quad f_i^+ = f_i^-,\quad d_i^+ = d_i^-,\quad t_i^+ = t_i^-,\quad \delta_i^+ = \delta_i^-,\)  
而 \(y_i^+ = 1,\qquad y_i^- = 0\)。  
这种构造减少了与标签相关的周围上下文差异,并为我们提供了直接的上下文内测试:当其他一切保持不变时,模型表征是否区分有效主张和无效主张?匹配对在拆分和自助重采样期间也保持在一起。  
### 3.3 数据集组成  
最终数据集包含 800 个样本,有效和无效推理各占一半。五个推理家族各贡献 160 个样本,五个语义域各贡献 160 个样本。三个难度层级包含 200 个单步样本、400 个两步样本和 200 个带有干扰前提的两步样本。严格的模板分割包含 600 个训练样本和 200 个保留样本。  
表 1:受控验证数据集的组成。  
### 3.4 泛化分割  
随机保留性能显示有效性在分布内是否可解码,但它并不能告诉我们探针是否依赖于熟悉的措辞、语义内容或特定于推理的结构。因此,我们评估四种互补的训练-测试条件。  
*随机分割*作为分布内参考,训练和测试样本从相同的总体混合中抽取。在*模板保留分割*中,完整的模板家族被排除在训练之外,以测试解码是否转移到未见的表面形式。*域保留分割*评估在训练期间缺失的语义域上的探针。*推理家族保留分割*保留整个推理家族,并测试对新推理结构的转移。  
这些条件并不旨在形成严格的难度层级。相反,它们探测不同类型的泛化:从普通的分布内预测到表面形式、语义内容和推理结构的变化。  
### 3.5 控制与范围  
所有样本都根据已知推理规则确定性生成,因此金标准标签是通过构造而非语言模型分配的。我们保留描述推理家族、域、模板家族、难度、干扰状态和分割成员资格的元数据,用于后续的子组和控制分析。  
数据集有意是诊断性的,而非全面的。其目的是区分几个问题:模型是否在输出中表达有效性;有效性相关信息是否在隐状态中可及;它是否泛化到探针训练分布之外;以及当最终答案错误时,它是否仍然可及。  

## 4 实验设置  
我们在三个层面上评估逻辑验证:输出行为、隐状态中的线性可及性以及探针推导有效性方向的因果效应。完整的实现和统计细节见附录 B (https://arxiv.org/html/2609.02438#A2) 和附录 C (https://arxiv.org/html/2609.02438#A3)。  
### 4.1 模型与行为评估  
我们评估 Pythia-1.4B、Pythia-2.8B、SmolLM3-3B、Llama-3.2-3B(以下简称 Llama-3.2)和 Mistral-7B。因果干预在 Pythia-2.8B、Llama-3.2 和 Mistral-7B 上运行。所有模型在相同的 800 个样本和分割定义上进行评估。行为通过分配给“有效”和“无效”的似然性来衡量。  
对于标签分数 \(s_V(x)\) 和 \(s_I(x)\),我们预测 \(\hat{y}(x) = \mathbb{I}[s_V(x) > s_I(x)],\qquad M(x) = s_V(x) - s_I(x),\)  
其中 \(M(x)\) 是连续的输出边际。我们报告准确率、分配为“有效”的预测比例和边际 AUC。答案-标签分词对每个模型分别审核;详情见附录 B (https://arxiv.org/html/2609.02438#A2)。  
### 4.2 隐状态探针  
对于每个 Transformer 块,我们提取最终的提示令牌隐状态,并拟合一个 \(\ell_2\) 正则化的逻辑回归探针以预测金标准有效性。特征标准化,超

相似文章

相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题

arXiv cs.CL

本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。