语言模型编码命题的语境真实性
摘要
本文研究了大语言模型(LLMs)如何将情境真值——即真值取决于上下文证据的命题——编码为激活空间中的线性方向,表明这些表征在不同输出策略下持续存在,并可通过对话方的断言而发生偏移,相关证据将表征偏移与谄媚行为联系起来。
arXiv:2608.03035v1 公告类型:新论文
摘要:先前工作表明,LLMs 在激活空间中沿线性方向编码事实性命题的真值。但目前尚不清楚这些表示如何扩展到上下文真值(contextual truth),即由上下文证据而非世界知识决定真假的命题。我们证明,LLMs 能够维持一种上下文真值的线性表示,这种表示在结构上不同的输出策略下依然存在,即使输出并不要求模型判断命题的真假;我们还通过引导(steering)实验提供了因果证据。利用一个协作式视觉-语言任务中的对话记录——该任务要求两个 LLMs 维持共享的共同基础——我们表明,命题的真值表示会显著受到合作方对该命题断言的影响,即使该 LLM 有足够证据判断其真假。我们发现,接近决策边界的命题更容易通过合作方的断言而发生真值偏移。将表示与输出相分离,可以区分出仅凭输出行为无法识别的两种奉承(sycophancy)形式:模型可能接受一个错误命题,同时继续将其表示为假;也可能使其表示越过边界发生偏移。当模型通过明确重述错误主张来表示同意时,后一种情况的发生率是隐式同意时的 2.59 倍。
查看缓存全文
缓存时间: 2026/08/05 07:42
# 语言模型编码命题的上下文真值
来源:https://arxiv.org/html/2608.03035
Rupak Sarkar∗, Pritika Ramu†, Rachel Rudinger
University of Maryland, College Park
{rupak,pramu}@umd.edu
# 语言模型编码命题的上下文真值
Rupak Sarkar∗, Pritika Ramu†††表示同等贡献。, Rachel Rudinger
University of Maryland, College Park
{rupak,pramu}@umd.edu
先前工作表明,LLM 会在激活空间中沿线性方向编码事实性命题的真值。目前尚不清楚这些表示如何扩展到上下文真值:即由上下文中的证据而非世界知识决定的命题真值。我们证明,LLM 维持了对上下文真值的线性表示,这种表示在结构不同的输出策略下仍然存在,即使输出并不要求模型确定命题的真值,并且我们通过引导(steering)实验提供了因果证据。利用一个需要两个 LLM 维持共享共同基础(common ground)的协作式视觉-语言任务转录,我们表明,命题的真值表示会受到伙伴对该命题断言(assertions)的显著影响,即使 LLM 已拥有足够的证据来确定其真值。我们发现,接近决策边界的命题更容易因伙伴断言而使其真值发生偏移。将表示与输出分离,可以区分两种仅凭输出行为无法区分的谄媚(sycophancy)形式:模型可能接受一个虚假命题,同时仍将其表示为假;或者将其表示越过边界进行偏移。当模型通过明确重述虚假声明来表示同意时,后一种情况的发生频率是隐式同意时的 2.59 倍。
## 1 引言
随着 LLM 在日益复杂的协作场景中与人类互动,它们必须能够可靠地根据对话上下文确定一个陈述的真值(“上下文真值”)。例如,如果一位正在计划晚餐的用户先提到有三位客人要来,但后来告知有两位已经取消,那么协助预订的 LLM 必须跟踪到只剩一位客人——这是一个只能依靠前述上下文信息来确定的命题——并将“三位客人要来吃晚餐”编码为假。虽然近期工作表明,LLM 激活空间中的线性方向能够以高准确率区分真假陈述(Marks and Tegmark, 2024;Bürger et al., 2024),但确定命题的上下文真值与回忆关于世界的事实(如“巴黎是法国的首都”)是不同的。在这些事实性真假陈述上拟合线性探针,难以区分“模型将命题 p 编码为真”和“模型记住了命题 p”,后者通常对预训练数据中是否存在该内容十分敏感。此外,事实性陈述的真值在对话过程中通常不需要更新,而 LLM 需要不断更新其对上下文陈述的表示:在多智能体协作场景中,“真值”通常就是对话中已经确立的内容,而与世界事实无关。
我们将 Marks and Tegmark (2024) 的 mass-mean 探针扩展到这样一种场景:上下文中的信息足以确定命题真值,并用它来区分模型对真与假陈述的表示。这消除了此前的混淆因素:陈述是否出现在训练数据中,对其真值能否被准确判定并不重要。研究 LLM 中的上下文真值表示,使得探针方法可以应用于任务型对话、多轮推理以及信息不对称下的信念跟踪等场景,这些任务中准确区分真假陈述非常重要。
在先前工作中,用于识别真值表示的提示(prompts)要求模型要么显式确定陈述的真值,要么隐式计算真值以回答探针问题(Bürger et al., 2024;Orgad et al., 2025;Bao et al., 2025)。这带来一种可能性:通过要求模型陈述命题真值的探针所恢复的方向,可能只是该输出模式的产物。然而,我们发现上下文真值并非如此——在各种任务设置下,即使任务本身不需要区分真假陈述,我们也能一致地恢复出区分真假陈述的方向。沿该方向进行引导会将模型的输出概率移向相反标签,而那些真值无法由上下文确定的命题则处于中间位置,比被明确反驳的命题更接近决策边界。
此外,我们在一项目标导向任务(Sarkar et al., 2026)的设置下考察真值表示。在该任务中,上下文以协作方式构建为对话共同基础,即参与者在对话中相互承认其为真的命题集合(Stalnaker, 2002;Clark and Schaefer, 1987)。在这种设置下,对话伙伴做出的断言是对更新共同基础的提议,这给 LLM 带来了纯观察者设置所没有的压力。它必须在断言命题的真值与其自身的证据之间进行权衡。Sarkar et al. (2026) 研究了这如何导致谄媚,即 LLM 因伙伴断言而错误地接受某个命题。我们对此现象提供了一种表示层面的解释,表明伙伴断言确实会改变真值表示本身。
综上所述,我们证明:
- LLM 激活编码命题的上下文真值(§4.1);
- 这一方向存在于一系列期望输出行为中,包括正确输出并不依赖于确定陈述真值的设置(§4.2);
- 它与模型的输出分布在因果上相关(§4.3);
- 它能将上下文中未被确定的命题与明确被反驳的命题区分开来(§4.4)。
在从协作任务获得的对话转录上(§5),我们表明伙伴断言会影响真值表示,在某些情况下会使其投影越过探针的决策边界(§5.3),从而能够区分两种仅凭输出行为无法区分的谄媚形式(§5.4)。
## 2 背景
#### 上下文真值(Contextual Truth)。
我们定义一个命题 p 在给定前提 C 下为上下文真,当且仅当 C 蕴含 p;或者在对话设置中,当且仅当 p 位于先前对话轮次所建立的共同基础中。真值完全由 C 决定,与模型在训练中可能学到的任何世界事实无关。例如,给定表 1 中的上下文(故事),“节拍器在书桌抽屉里”和“朱利安相信节拍器在书桌抽屉里”都是其真值由上下文推导出的命题。
故事。朱利安走进了练习厅。朱利安把节拍器移到了健身房包里,这个包也位于练习厅内。朱利安私下告诉阿比盖尔,节拍器在健身房包里。朱利安又把节拍器移到了书桌抽屉里,这个抽屉同样位于练习厅内……
| 顺序 | 真值 | 命题 |
|---|---|---|
| P0 | 真 | 节拍器在书桌抽屉里。 |
| P0 | 假 | 节拍器在健身房包里。 |
| P1 | 真 | 朱利安相信节拍器在书桌抽屉里。 |
| P1 | 假 | 朱利安相信节拍器在健身房包里。 |
表 1:ExploreToM 示例。命题根据世界状态(P0)和角色信念状态(P1)构建。图 LABEL:fig:trajectory 追踪命题真值随故事展开的变化。
## 3 实验设置
### 3.1 数据集
我们需要这样的数据:对于给定的 \((C,p)\) 对,我们拥有由 C 单独决定的 p 的金标真值标签。虽然 SNLI(Bowman et al., 2015)符合这一格式,但潜在的预训练污染和仅基于假设的伪特征(Poliak et al., 2018)使其不太适合隔离上下文真值表示。
#### ExploreToM。
ExploreToM(Sclar et al., 2025)是一个由程序化生成的对抗性故事基准,旨在测试 LLM 的心智理论(theory-of-mind)能力。我们将该基准改造为生成 \((C,p)\) 对,因为程序化生成可以确保无歧义的黄金真值。在选定的故事时间步,我们使用世界状态和角色信念状态来构建真命题和假命题。P0 命题基于世界状态构建(例如,物体实际所在位置),而 P1 命题基于角色的信念状态构建(例如,角色认为物体所在位置)。为了构建训练集,我们只保留模型能够准确报告真/假值的 \((C,p)\) 对。随后对样本进行平衡,使命题中的实体提及(角色、容器、房间)在 P0、P1 以及真/假标签之间分布均衡。训练集(\(n=4000\))和测试集(\(n=4000\))的房间、容器和物体来自不重叠的语义主题。更多数据集统计见附录 C。
### 3.2 探针构建与定位
探针使我们能够近似内部表示中存在的信息(Alain and Bengio, 2018),我们用它来研究模型对真值的内部表示。当我们在某个(层、位置)元组上识别出一个“真值方向”时,这表明模型对真与假陈述进行了不同的编码。虽然一些文献将其视为 LLM“信念”的代理,但该术语的哲学有效性不在我们的讨论范围内。无论如何,分析这些表示能为我们理解模型行为提供有价值的洞见。
#### 均值差(Difference-in-Means)。
我们遵循 Marks and Tegmark (2024) 定义 mass-mean 探针:
\[
\boldsymbol{\theta}_{A} = \boldsymbol{\mu}_{A}^{+} - \boldsymbol{\mu}_{A}^{-}
\]
其中 \(\boldsymbol{\mu}_{A}^{\pm}\) 是任务 A 训练集中真/假项目在所选(层、位置)组合处的平均激活。该探针即为对向量的简单投影:
\[
p(x) = \boldsymbol{\theta}^{T} x
\]
我们使用训练集上投影类均值的中点作为决策阈值,用于报告测试集及其他任务上的分类准确率。在本文其他部分,我们用 \(\theta_{\tau}\) 指代在任务 \(\tau\) 上拟合的 mass-mean 探针。最终的探针 \(\theta_{\textsc{base}}\) 在 P0 和 P1 训练激活上联合拟合,以最大化训练分布中的变化。
#### 基础任务提示词。
我们构建提示词以引出命题的真值表示。对于每个 \((C,p)\) 对,我们通过拼接故事、命题和如图 1 所示的指令模板来形成单个输入。对于经过指令微调的模型,我们将该任务描述放入系统消息中,且不提供示例。
```
[EXAMPLES]
故事:{premise}
陈述:{hypothesis}
根据故事,该陈述为(回答 TRUE 或 FALSE):
```
图 1:基础模型使用的提示模板。
#### 读出位置。
我们在命题结尾的句号 token 处读取残差流。命题的最后一个内容词 token 也携带强信号,但其身份与命题内容共变,因此在该位置使用探针可能捕捉到词汇结构(Marks and Tegmark, 2024;Bürger et al., 2024)。不同读出位置的实验见附录 D。
#### 层选择。
我们遵循 Bürger et al. (2024),选择使残差流激活的类间方差与类内方差之比(在所有维度上平均)最大化的读出层。在图 2 中,我们注意到该比值在模型的中后期层达到最高。我们观察到探针准确率在一系列中后期层上趋于饱和,表明该方向在多层中冗余存在(附录 A)。
图 2:在句号 token 处,不同层上的类间方差与类内方差之比。
### 3.3 评价指标
我们使用两种指标来量化真值方向在某个(层、位置)组合表示空间中的强度。为了与 Marks and Tegmark (2024) 保持一致,分类准确率使用第 3.2 节中描述的中点阈值;虽然最优阈值可能无法干净地跨任务迁移,但保持其固定可以告诉我们该阈值的可迁移性。Cohen's d 以合并标准差为单位衡量类均值的分离程度,我们用它来量化任务内部以及跨任务的分离强度。
### 3.4 基线
我们将 mass-mean 探针与两个零基线进行比较,以验证它捕捉的是真实的上下文真值方向,而非激活几何的伪影。随机方向零基线从球面上均匀采样 1000 个单位向量,将每个向量缩放到探针的范数,并将目标激活投影到这些向量上,检验沿任意轴能达到多大的分离。标签打乱零基线对训练集真值标签进行置换并重新拟合探针,重复 1000 次,以控制探针在激活空间的任意二分类划分中可能恢复出的结果。
## 4 结果
我们探测了 Llama-2(13B, 70B)(Touvron et al., 2023)和 Qwen3(14B-Base, 14B, 32B, VL-32B-Instruct)(Yang et al., 2025)。
### 4.1 上下文真值方向存在
为了确定上下文真值被线性地表示在模型激活中,我们在第 3.2 节所选定的(句号 token, 层)位置上,于 ExploreToM 训练集上拟合 mass-mean 探针(\(\theta_{\textsc{base}}\)),并在测试集上进行评估(表 2),发现各模型均持续获得高准确率(比随机高 \(+0.25\) 到 \(+0.39\))。测试集更具挑战性,因为它还包含模型会答错的 \((C,p)\) 对。我们测试了不同的命题分隔符,以确保我们的发现不是提示词的伪影(附录 E)。相似文章
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
LLM蕴含多样性:部署环境如何重塑模型层面的偏好与价值观
本文探讨大型语言模型在不同部署环境中是否具有稳定的偏好,发现环境变化引起的差异远大于提示扰动,表明测得的偏好是环境条件决定的而非固定属性。
大语言模型作为语言学中的模态模型
本文运用科学哲学框架论证,大语言模型作为最小模型在语言学中具有认识论价值,可用于提供可能性解释,但尚不足以构成对人类语言的实际性解释。
解构LLMs中谄媚行为的内部表征
本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。
信念还是电路?上下文图学习的因果证据
本文使用主成分分析(PCA)和激活补丁等机制可解释性方法,在一个图随机游走任务上探究了大型语言模型是通过潜在结构推断还是局部模式匹配来进行上下文学习。