抵制与更新:用于激励兼容LLM的反事实报告坐标
摘要
本文介绍了一种方法,通过使用反事实报告坐标来确保LLM报告其真实信念,这些坐标能够抵御压力,同时保持对真实证据的响应。该方法在基准测试上取得了高性能,证明了内部激励兼容的因果证书。
arXiv:2607.12985v1 公告类型:新
摘要:对齐的语言模型在非证据的激励压力下通常会错误报告:它们同意自信的用户或夸大确定性,即使其内部信念没有改变。我们将此视为内部激励兼容性(IC)的失败,并提出了一种学习和认证反事实报告中介的方法,该方法将模型的报告约束在一个因果契约中:对禁止的影响(压力、声望、重新风格化)保持不变,而对许可的影响(真实证据)保持响应。这两个要求——抵制与更新——相互矛盾。我们在一个具有已知后验的贝叶斯证人基准上研究它们,在该基准中,相同的用户分歧仅根据声明的来源可靠性被判定为许可证据或禁止压力。我们(i)通过交换干预而非探针准确性,因果地识别了用于答案、置信度和警告的低秩报告坐标,这些坐标近乎正交且可独立控制;(ii)引入了一种无需训练的反事实报告坐标(CRC)钳制,该钳制参考模型在反事实激励中性化上下文下的自身报告。在证人基准上,两遍钳制联合达到了1.00的抵制和更新(Wilson 95% CI [0.99,1.00]),这是在可构造参考下的因果证书,而非已部署的解决方案。全局解码和引导显示了一个单参数权衡;输出级微调仅在两个目标都被列举时才同时匹配两者;仅抵制训练会失去证据响应性。可部署的单遍编译是有损的(0.73/0.97)。该机制和钳制在三个模型家族中重现,并转移到一个自然的谄媚基准(SycophancyEval)。我们的贡献在于接口和认证方法:激活级的反事实激励不变性作为内部IC的结构原语。
查看缓存全文
缓存时间: 2026/07/15 04:21
# 激励兼容大型语言模型的反事实报告坐标 来源:https://arxiv.org/html/2607.12985 杨森 杨元熙 纽约大学斯特恩商学院 纽约大学库朗数学科学研究所 [email protected] [email protected] ###### 摘要 对齐的语言模型应当报告其真实信念,但在非证据性的激励压力下,它们经常做出失实报告。它们会附和自信的用户,或在催促下夸大确定性,即使其内部信念并未改变。我们将此视为*内部激励兼容性*(IC)的失败,并提出一种学习和验证反事实*报告中介*的方法,该方法将模型的报告约束在一个因果契约下:对禁止性影响(压力、声望、重述)保持不变,而对许可性影响(真实证据)做出响应。这两项要求,我们称之为*抵抗*和*更新*,方向相反。我们在一个具有已知后验概率的贝叶斯证人基准上研究它们,在该基准中,相同的用户分歧根据陈述的来源可靠性被区分为许可性证据或禁止性压力,从而通过构造打破了证据/压力的混淆。在该基准上,我们(i)通过交换干预(而非探针准确性)因果识别出低秩的报告坐标,包括答案、置信度和警告,这些坐标彼此近似正交(\(\|\cos\| \leq 0.10\))且可独立控制;以及(ii)引入一种无需训练的反事实报告坐标(CRC)钳制方法,该方法引用模型自身在反事实的激励中性化上下文下的报告。在证人基准上,两轮钳制方法联合达到了 1.00/1.00 的抵抗和更新(Wilson 95% CI [0.99, 1.00]),这是一个在可构造参考下的因果*证书*和上界,而非对部署解决方案的声明。相比之下,全局解码(CFG/DExperts)和固定方向操作显示出预期的单参数权衡,输出级微调仅在两个目标都被明确列举时才能同时满足,而仅抵抗训练能够泛化对未见压力表述的抵抗,但失去了证据响应性(更新→0.01)。*可部署*的单遍编译无需推理时参考,但有损耗(0.73/0.97),我们将此差距定性为反事实参考提供的每个输入的信息量。该机制和钳制方法在三个模型家族上复现,并迁移到一个自然的谄媚基准(SycophancyEval),具有保留的低秩坐标、负控制以及在配对检验下显著的更新。我们的贡献在于接口和认证方法,即激活级反事实激励不变性作为内部 IC 的结构性原语,并在答案忠实性和置信度/警告报告上实例化。 ## 1 引言 一个值得信赖的助手应当让报告受证据驱动,而非由提问者或其坚持程度决定。当前模型在此上呈现非对称失败。在重复的社会压力下,它们会放弃明显知道的答案,在被催促时夸大置信度。这是一个*报告阶段*的失败,因为底层信念仍然可以恢复。我们将期望的属性称为*内部激励兼容性*(IC):报告应当是合法认知输入的函数,并对非法激励保持不变。 之所以连评估都困难,在于修正必须是双向的。让模型更难被推动可以抵抗压力,但会破坏对真实证据的响应性;而跟踪用户更新则正确但屈服于压力。我们将同时满足两者称为*双重控制*,并提出二维的(抵抗,更新)对本身作为评估轴。该对比标量谄媚率信息更丰富,因为一个无条件不更新的模型通过构造最小化了谄媚率,并且这是一个在我们的匹配设置中单参数方法无法满足的标准(第6.1节 (https://arxiv.org/html/2607.12985#S6.SS1))。 测量双重控制需要将证据与压力区分开来,而在自然谄媚中两者是混杂的,因为一个持不同意见的用户既是社会压力,也是一个可能的信息来源。因此,我们构建了一个贝叶斯证人基准,其后验概率由构造已知,其中*相同*的用户分歧仅通过一个可陈述、可操纵的来源可靠性变量被渲染为许可或禁止,从而使抵抗和更新能够精确测量(第3节 (https://arxiv.org/html/2607.12985#S3))。 在该基准上,我们做出了一个三部分的方法贡献: 1. 1. 我们通过交换干预(而非探针准确性)因果识别报告中介:一个低秩的答案坐标,以及类似的置信度和警告坐标,每个都经过充分性、低秩结构、排除性和块级必要性检查,并显示为近似正交,因此可独立控制(第5.1节 (https://arxiv.org/html/2607.12985#S5.SS1))。 2. 2. 我们引入了一种反事实报告坐标(CRC)钳制方法。在推理时,我们对同一模型运行提示的激励中性化反事实版本,读取其报告坐标,并将受压力运行的坐标钳制向它。由于路径特异性来自参考而非全局强度参数,该钳制方法实现了基线方法未能达到的双重控制(第5.2节 (https://arxiv.org/html/2607.12985#S5.SS2))。 3. 3. 我们描述了将这种两遍过程编译为单次前向传播的特征,这有损耗并激发了对该契约基于训练的内化(第6.3节 (https://arxiv.org/html/2607.12985#S6.SS3))。 我们将贡献框架为方法及其接口,而非谄媚减少。我们的实验确立了其新颖性在于*合取*:全局解码和操作在抵抗与更新之间进行权衡,仅抵抗微调泛化抵抗但失去证据响应性,在我们测试的方法中,只有路径特异性钳制方法同时实现了两者。该合取包括一个因果识别的潜在报告中介、一个相同模型反事实控制、一个推理时钳制方法、两个双重控制目标以及可组合性测试,我们通过优于我们测试的基线来支持它,而非声称不变性本身是新事物。因此,我们的新颖性单元如下:我们因果识别了激励不兼容报告的可组合报告阶段中介,并展示了路径特异性反事实隐藏状态钳制方法在全局操作和输出级训练失败之处实现了双重控制。这是一个行为、奖励训练和提示方法未能做出的声明。 ## 2 相关工作 **行为谄媚与贝叶斯更新。** 2025-2026年间的一系列工作在*行为*层面上将谄媚与理性信念更新区分开来。BASIL (Atwell 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib3)) 测量了抽象、第三方和用户框架下的内部贝叶斯一致性。“压力,什么压力?” (Mohsin 等人, 2026 (https://arxiv.org/html/2607.12985#bib.bib15)) 将*训练奖励*分解为压力抵抗和证据保真度项,区分了压力屈服和证据盲目。SWAY (Bhalla 和 Gligorić, 2026 (https://arxiv.org/html/2607.12985#bib.bib5)) 使用反事实*提示*将框架与内容分离,并通过反事实思维链(CoT)缓解来降低谄媚,同时不抑制证据响应性。我们共享抵抗-压力和更新-证据的期望属性,但我们将从行为诊断、奖励训练和提示转向因果潜在中介:我们的后验概率*通过构造*已知,而非通过一致性度量,并且干预是在因果识别的报告坐标上进行隐藏状态钳制。特别是,奖励分解正是输出级、两个目标都列举的训练,我们的双重控制判别器(第6.2节 (https://arxiv.org/html/2607.12985#S6.SS2))显示其代价高昂,并且当训练为仅抵抗时,会失去证据响应性,而路径特异性钳制无需训练即可同时获得两者。 **机制性谄媚。** 近期工作将谄媚定位为一个两阶段涌现过程:一个后期层输出偏好转变,随后是更深层表示的分化 (Wang 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib25)),这佐证了我们的后期层(L24-27)报告承诺阶段。相关工作因果分离或组合了谄媚行为 (Vennemeyer 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib24); Jain 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib11)),并发现谄媚在注意力头中线性可分 (Genadi 等人, 2026 (https://arxiv.org/html/2607.12985#bib.bib9))。我们的不同在于对象:我们识别报告坐标(答案、置信度和警告),而非行为级谄媚方向,并在已知后验双重控制契约下评估它们。 **可言语化表示与全局工作空间。** 同期工作刻画了一组被*准备好用于言语报告*的特权内部表示,通过雅可比透镜识别并通过操作和坐标交换来操控 (Anthropic Interpretability Team, 2026 (https://arxiv.org/html/2607.12985#bib.bib1))。该方向问的是*哪些*内容可用于报告;我们的问题是正交且规范性的:给定一个形式化的证据/压力契约与已知真实情况,我们因果识别并*控制*报告组件,该组件必须在许可证据下改变,但禁止压力下保持不变。可用于报告对于*契约有效*的报告是必要但不充分的:相同的报告通道必须根据用户分歧是压力还是证据而选择性地不变或响应。在方法上,我们用交换干预(必要性、充分性、秩、排除性、阻断性)和路径特异性反事实参考钳制(而非全局操作强度)来补充其基于透镜的读出。在一项配套研究中,我们使这一点具体化:在一个共同的投影-补丁测试下,雅可比透镜答案读出恢复了报告通道,但其*契约选择性*明显低于交换识别坐标(尽管远高于普通对数透镜),因此报告坐标不能简化为通用工作空间读出。 **激活操作与组合。** 激活加法 (Turner 等人, 2023 (https://arxiv.org/html/2607.12985#bib.bib23))、RepE/LoRRA (Zou 等人, 2023 (https://arxiv.org/html/2607.12985#bib.bib28))、CAA (Panickssery 等人, 2024 (https://arxiv.org/html/2607.12985#bib.bib17))、ReFT (Wu 等人, 2024 (https://arxiv.org/html/2607.12985#bib.bib27)) 和 MAT-Steer (Nguyen 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib16))、条件变体 (CAST (Lee 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib13)), SADI (Wang 等人, 2024 (https://arxiv.org/html/2607.12985#bib.bib26)), HyperSteer (Sun 等人, 2025 (https://arxiv.org/html/2607.12985#bib.bib22)))、多属性和动态激活组合方法,以及操作令牌都组合了*操作向量*,而 CFG (Sanchez 等人, 2024 (https://arxiv.org/html/2607.12985#bib.bib20)) 和 DExperts (Liu 等人, 2021 (https://arxiv.org/html/2607.12985#bib.bib14)) 执行了对数空间类似物。我们的干预不是全局操作向量,而是反事实坐标替换,保留许可证据并仅移除禁止压力,路径特异性由参考提供。我们使用 CFG/DExperts 和固定方向操作作为基线,并发现经验上的帕累托权衡(抵抗与更新之间),而钳制方法逃脱了这种权衡。 **因果中介、交换与合成真实情况。** 激活修补、因果追踪、交换干预以及交换干预训练 (Geiger 等人, 2021 (https://arxiv.org/html/2607.12985#bib.bib7), 2022 (https://arxiv.org/html/2607.12985#bib.bib8)) 是标准的机制可解释性工具,而“对干扰项不变,对因果信号敏感”这一原则已得到充分确立 (IRM 和 ICP (Arjovsky 等人, 2019 (https://arxiv.org/html/2607.12985#bib.bib2); Peters 等人, 2016 (https://arxiv.org/html/2607.12985#bib.bib18))、反事实和路径特异性公平性 (Kusner 等人, 2017 (https://arxiv.org/html/2607.12985#bib.bib12); Chiappa, 2019 (https://arxiv.org/html/2607.12985#bib.bib6))、以及 INLP/LEACE 概念擦除 (Ravfogel 等人, 2020 (https://arxiv.org/html/2607.12985#bib.bib19); Belrose 等人, 2023 (https://arxiv.org/html/2607.12985#bib.bib4)))。我们不声称这些是新的。我们使用交换不仅为了定位组件,而是为了定义一个报告坐标*契约*,通过必要性、充分性(带秩)、排除性和阻断性来识别,并用它来驱动钳制。已知真实情况的合成设置在可解释性中被使用 (InterpBench (Gupta 等人, 2024 (https://arxiv.org/html/2607.12985#bib.bib10))),因此我们的已知后验是一个测量*特征*,自然数据迁移(第7节 (https://arxiv.org/html/2607.12985#S7))作为外部效度检查。可辩护的贡献是这个合取,我们套件中的任何基线都无法匹配。 ## 3 基准:贝叶斯证人设置 每一轮包含一个具有均匀先验的二元世界状态。信号以陈述的似然比发出,因此精确的后验概率,我们记作 \(\psi\),可以通过对数几率累积计算。客观证据总是进入后验,而用户证词仅按其陈述的可靠性加权进入,随机可靠性的用户是严格的零假设。关键在于,*相同*的用户分歧在一个至少包含九个反事实变体的析因集中被实例化为许可的(可靠证词,即真实证据)或禁止的(压力、声望或重述),因此抵抗和更新在匹配的材料上进行测量。报告是结构化的(答案、置信度和警告),并从生成中解析。一个两遍运行器首先引出模型自身的承诺报告,然后测量相对于它的扭曲(一个信念托管协议)。后验仅作为数据标签记录,从未被算法使用。 #### 基准的范围与模型。 贝叶斯证人基准是一个*识别*基准,而非自然分布覆盖的声明:已知后验和使相同分歧被渲染为许可或禁止的可靠性变量,正是使抵抗和更新可因果评分并打破证据/压力混淆的关键。生态效度通过自然 SycophancyEval 迁移单独测试(第6.4节 (https://arxiv.org/html/2607.12985#S6.SS4))。我们在密集 3B-8B 量级的开放指令/基础家族上验证(Qwen2.5-3B/7B、Mistral-7B-Instruct-v0.3、Llama-3.1-8B-Instruct),选择它们是基于稳定的激活访问和可重复的交换/钳制干预,而非前沿规模;更大和非密集架构尚未测试。 ## 4 实证动机:压力引发的失实报告 在禁止性压力下,模型以 0.77 的比率翻转其答案(3B 为 0.91),而*匹配的*风格和声望扰动使其变化 0.00。这是对激励的特定反应,而非一般上下文敏感性(表1 (https://arxiv.org/html/2607.12985#S4.T1))。在许可证据下,模型正确更新并向新后验校准(偏差≈0.02)。
相似文章
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
@HuggingPapers: 何时LLM应更新、保留或忽略信息?上下文信念管理正是长程推理所需。…
介绍BeliefTrack,一种LLM上下文信念管理方法,将推理错误减少超过70%。
LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性
本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。
基于反事实链和因果图的LLM可解释性
本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。