相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题

arXiv cs.CL 论文

摘要

本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。

arXiv:2607.26929v1 公告类型:新 摘要:当因果主张涉及不同的人群、结局、估计目标、路径或识别假设时,相同的诊断结果可能支持或挑战某一因果主张,却无法回应另一主张。当证据和目标同时变化时,一个正确的答案可能反映有利或不利的措辞、词汇重叠或熟悉的诊断模式,而非将证据与因果问题相匹配。我们引入了配对提示,重复相同的诊断证据原文,同时改变因果目标。根据证据与因果问题的关系,每个提示被标记为“支持”、“挑战”、“未解决”或“错误目标”。只有当两个提示都被正确分类时,该对才算被恢复。使用在独立开发集上训练的线性读出,我们分析了Qwen2.5-7B-Instruct、Qwen3-8B和Llama-3.1-8B-Instruct的倒数第二个Transformer模块的最终令牌隐藏状态。在涵盖九个诊断类别的49对主要基准测试中,平衡准确率范围为0.654至0.659,恢复了18-21对。两名独立的人类评审员对98个提示中的95个给出了相同的标签(96.9%)。在各个检查点,平衡准确率和完整对恢复率均超过保留开发场景组别的置换零假设。在Qwen2.5中,完整提示的平衡准确率超过了两种受限输入,且两个差异的配对自助法区间均高于零。在未使用评估诊断类别开发示例的情况下训练的读出恢复了21对,包括九个类别中每类至少一对。隐藏状态读出在平衡准确率和恢复对数量上均超过了基于答案选项对数几率和文本基线的线性分类器。这些结果表明,隐藏状态包含关于诊断证据是支持、挑战还是无法回应因果目标的线性可解码信息。
查看原文
查看缓存全文

缓存时间: 2026/07/30 10:00

# 相同证据,不同目标:从语言模型状态解码诊断证据如何影响因果问题

来源:https://arxiv.org/html/2607.26929

###### 摘要

相同的诊断结果可以支持或质疑某个因果主张,却无法解答另一个主张——当这些主张涉及不同的人群、结果、估计量、路径或识别假设时。当证据与目标在示例中同时变化时,正确的答案可能反映的是有利或不利的措辞、词汇重叠或熟悉的诊断模式,而非将证据与所请求的因果问题相匹配。我们引入了配对提示词(paired prompts),它们逐字重复相同的诊断证据,但改变因果目标。每个提示词根据证据对所提因果问题的影响程度,被标记为支持(Favors)、挑战(Challenges)、未解决(Unresolved)或错误目标(Wrong Target)。只有当两个提示词都被正确分类时,该配对才算恢复成功。

使用在单独开发集上训练的线性读出(linear readouts),我们分析了Qwen2.5-7B-Instruct、Qwen3-8B和Llama-3.1-8B-Instruct倒数第二个Transformer块的最终token隐藏状态。在涵盖九个诊断类别的49对主要基准测试中,平衡准确率介于0.654至0.659之间,恢复的配对数为18至21对。两位独立的人类评审员对98个提示词中的95个(96.9%)给出了相同的标签。在各个检查点上,平衡准确率和完整配对恢复均超过了保留开发场景分组的置换零假设。在Qwen2.5中,完整提示词的平衡准确率超过了两类受限输入,且两个差异的配对自助法(paired-bootstrap)区间均大于零。在开发集中排除被评估诊断类别的示例后训练的读出,恢复了21对,包括九个类别中各至少一对。该隐藏状态读出在平衡准确率和恢复配对数量上,均超过了基于四个答案选项逻辑值的线性分类器以及所有测试的文本基线。这些结果表明,倒数第二个块的最终token隐藏状态包含关于诊断证据是支持、挑战还是未能针对指定因果目标的可线性解码信息。

参见图注图1:具有相同证据和配对级别评估的配对问题。左:一个基准配对保持诊断证据相同,同时将因果问题从τ1变为τ2。在示例配对中,证据通过节能提示挑战了排他性约束,但未涉及房东-装修路径,得到(挑战,错误目标)。中:同一检查点处理两个提示词,一个共享的线性读出函数gφ,在不相交的开发集上拟合,从倒数第二个块的最终token隐藏状态预测每个标签。右:只有两个预测都与黄金标签匹配时,该配对才被视为恢复成功。

## 引言

因果证据只有在针对它实际解决的问题时才有信息量。假设随机化的提醒信件被用作智能电表安装的工具变量。在无法安装电表的家庭中,信件仍然减少了用电量,因为它们包含节能提示。这一结果挑战了估计安装效应的排他性约束:即使安装无法发生,提醒也可能影响结果。然而,同样的结果对于另一种不同的拟议违规行为(例如通过房东施压装修的路径)则毫无意义。证据未变;只是被审查的因果路径不同。一个只对不利诊断模式做出反应的模型可能会同时挑战两个目标。正确的判断必须识别出证据实际测试的人群、处理、结果、估计量、路径或识别假设。

现有的基准测试检验语言模型是否能得出正确的因果结论,或判断证据是否支持或反驳一个主张。然而,当证据与目标在示例中同时变化时,存在几种捷径:模型可以遵循有利或不利的措辞,匹配证据与问题共享的术语,或者复用在类似诊断示例中见过的模式。因此,模型无需检查证据是否涉及问题中命名的人群、处理、结果、比较、估计量或识别假设,就能正确回答。更严格的测试必须逐字固定诊断证据,只改变因果目标。那么,成功就需要预测在目标改变时发生变化,即使证据没有改变。

为了测试模型是否能区分相同证据对不同因果问题的影响,我们构建了具有相同研究背景和逐字相同的诊断证据,但不同因果目标的提示词配对。我们将两个提示词称为配对的端点。在一个端点中,证据支持或挑战所请求的目标;在另一个端点中,相同的证据被标记为错误目标,因为它针对的是不同的因果问题。我们根据证据所针对的端点的黄金标签,将该配对称为支持对或挑战对。只有当两个端点的标签都被正确预测时,我们才计数该配对为已恢复。因此,模型无法通过给两个提示词分配相同的有利或不利标签来成功。主要基准测试包含来自九个诊断类别的49对配对。

接下来,我们询问在模型读取完整提示词后,是否能从其状态中恢复正确的标签。对于三个指令调优的检查点中的每一个,我们从倒数第二个Transformer块提取最终token隐藏状态,并在一个独立的开发集上拟合线性读出。在49对的主要基准测试中,平衡准确率范围从0.654到0.659,读出恢复了18到21对配对的端点。对于每个检查点,平衡准确率和完整配对恢复均超过了按场景分组的置换零假设。每个检查点也同时恢复了支持对和挑战对。

对于Qwen2.5,完整提示词的隐藏状态恢复了21对,而省略证据的输入和仅包含证据的输入均未恢复任何完整配对。当从读出开发集中移除被评估的诊断类别的所有示例时,得到的读出也恢复了21对,包括九个类别中各至少一个恢复的配对。得分最高的选项基线恢复了4对,而基于四个选项逻辑值的线性分类器恢复了8对;文本基线最多恢复了4对。两种受限输入均未重现完整提示词的结果,并且隐藏状态读出在完整配对恢复数量上超过所有测试的答案分数和文本基线。

这项工作做出了三个贡献。首先,它定义了一个配对评估任务,用于确定诊断证据如何影响指定的因果问题,使用支持、挑战、未解决和错误目标作为可能的标签。其次,它提供了一个涵盖九个诊断类别的49对基准测试,并用完整配对恢复(要求配对的两个端点都被正确预测)来评估模型。第三,在三个指令调优的检查点上,平衡准确率和完整配对恢复均超过了分组置换零假设。在Qwen2.5中,两种受限输入均未重现完整提示词的结果,当从读出开发中移除被评估的诊断类别时,两个指标仍高于零假设,并且隐藏状态读出恢复了比两个测试的答案分数基线更多的完整配对。总之,这些结果表明,在所有三个检查点上,正确的标签在固定的隐藏状态位置是可线性恢复的,两种受限输入均未重现Qwen2.5完整提示词的结果,并且当被评估的诊断类别不在读出开发中时,两个指标仍高于零假设。

## 基准测试

### 诊断证据如何影响因果问题

因果证据在其旨在解决的问题之外没有固定的解释。我们使用因果目标来表示被审查的特定因果问题,包括相关的人群、处理、结果、比较、估计量、路径或识别假设。对于每个提示词,我们根据诊断证据对该因果目标的影响分配四个标签之一。

令e表示诊断证据,τ表示因果目标,L(e, τ)表示分配的标签。我们写作

L(e, τ) ∈ {支持, 挑战, 未解决, 错误目标}。

支持意味着,根据所述的诊断标准,证据支持针对指定目标的所述条件。挑战意味着它对该条件不利。未解决意味着证据针对了目标但过于微弱或模糊,无法支持任何判断。错误目标意味着证据可能有效且信息丰富,但针对的是不同的因果问题。

这些标签是层次化的。我们首先询问证据是否针对所请求的目标。如果是,则分配支持、挑战或未解决。这种区分很重要,因为未解决的证据针对了正确的问题但未能解决;错误目标的证据则针对了其他问题。

这些判断是局部于被评估的诊断的。支持标签并不确立更广泛因果结论所需的每个条件,挑战标签也不使研究的其他所有部分无效。该基准测试只询问诊断证据如何影响被问及的因果问题。下一子节保持诊断证据固定,同时改变该问题。

### 具有相同证据的配对问题

标准评估通常将每个因果问题视为独立示例。由于证据和目标经常一起变化,正确的预测可能反映证据听起来是有利还是不利、词汇重叠或反复出现的诊断模式。它并不一定表明证据已被应用于所问的特定因果问题。

我们通过包含相同研究背景和相同诊断证据但指定不同因果目标的配对提示词来解决这个问题。我们将两个提示词称为配对的端点。在一个端点中,证据针对所请求的目标并被标记为支持或挑战。在另一个端点中,相同的证据针对不同的目标并被标记为错误目标。我们根据证据所针对的端点的黄金标签,将该配对称为支持对或挑战对。

例如,假设处理学校和对照学校在六年级数学方面具有相似的预处理趋势。当目标是六年级数学时,该证据支持平行趋势条件,但当问题是关于九年级数学时,它属于错误目标。诊断结果未变;只有所请求的结果不同。其他配对改变的是估计量、比较、工具、中介或识别假设,而不是明确命名的结果。

因此,配对而非单个端点才是评估的主要单元。仅看端点准确率可能具有误导性:一个仅跟循证据有利或不利措辞的模型可能正确分类证据所针对的端点,同时给两个提示词分配相同的标签。我们将完整配对恢复定义为两个端点都得到正确预测。因此,一个恢复的配对要求预测在目标改变时发生变化,尽管诊断证据相同。我们分别报告支持对和挑战对,以展示对于有利和不利的诊断结果是否都有恢复。

### 基准构建与验证

每个端点包含四个字段:一个目标声明、一个命名的因果条件、必要的研究背景,以及描述诊断结果的一条证据陈述。黄金标签分两步分配。我们首先确定诊断证据是否涉及端点中指定的人群、处理、结果、比较、估计量、工具、中介或识别假设。涉及不同因果问题的证据被标记为错误目标。当证据针对所请求的目标时,则根据其是否支持所述条件、对其不利或不允许做出明确的支持或挑战判断,将其标记为支持、挑战或未解决。在每个配对内,证据陈述被逐字重复,而目标声明、命名条件或必要背景会改变以指定不同的因果问题。

主要基准测试包含49对,即98个端点,每对基于不同的研究背景。它包含来自九个诊断类别的25个支持对和24个挑战对。在整个基准测试中,配对的问题以28种不同方式有所不同,涉及人群、处理、结果、对照组、估计量、工具、中介、调整规则、时间、观察来源、分配阈值或识别假设。这些配对不仅仅是替换实体名称:有些改变了诊断适用的人群、对照组或时间点;其他则改变了估计量、工具、中介、调整规则、分配阈值或识别假设。在每个配对中,证据句子及其有利或不利的措辞保持不变。标签变化仅仅因为问题询问的是因果分析的不同部分。表1(https://arxiv.org/html/2607.26929#Sx2.T1)总结了每个类别中的诊断问题和配对数量。

由于每个配对基于不同的研究背景,没有研究背景贡献多于一个主要配对。因此,完整配对恢复是在49个不同背景上测量的,而不是一小套场景的重复变体。

表1:最终49对基准的构成。一个独立的开发集包含144个端点,组织成18个场景组,涵盖所有四个标签。它用于标准化、正则化选择和读出拟合;主要基准端点不用于任何这些步骤。

两位独立的人类评审员(无法获取黄金标签、模型预测或实验结果)对所有98个主要端点进行了标注。他们在95个端点(96.9%;名义Krippendorff's α=0.953)上达成一致。对于98个端点中的94个(95.9%),两位评审员独立地分配了黄金标签;这在49对中的45对(91.8%)中适用于两个端点。对于每个配对中证据所针对的端点,黄金标签是支持或挑战。未解决保留在开发集中,但不用作主要黄金标签。

## 实验设置

### 模型与线性读出

我们评估Qwen2.5-7B-Instruct、Qwen3-8B和Llama-3.1-8B-Instruct。所有三个检查点接收语义相同的任务内容,通过每个模型的官方聊天模板渲染。Qwen3在非思考模式下评估。模型在处理提示词时不生成答案,直接提取表示。

对于每个提示词,我们从倒数第二个Transformer块提取渲染后的聊天提示词最终token处的隐藏状态。该token是模型聊天模板添加的助理生成前缀的结束。我们在评估主要基准之前固定了这个隐藏状态位置。

相似文章

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。

CalBrief:大型语言模型证据校准式科学简报的试点诊断基准

arXiv cs.CL

本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。