先承诺后推理:开放权重LLM中回答预承诺的行为复现与初步激活级证据
摘要
本文使用一个极简的洗车问题,在开放权重大型语言模型(Qwen3-8B)中复现了回答预承诺现象,并提供了初步激活级证据,表明承诺在答案文本生成之前就已编码在隐藏状态中。
arXiv:2607.16451v1 公告类型:新
摘要:聊天模型有时会先承诺一个答案,然后生成推理来证明它而不是推导出它——即使答案与任务前提矛盾。我们研究了一个最小探针:“我想洗车。洗车场在100米外。我应该步行还是开车?”只有开车可行(车必须在洗车场),但模型绝大多数推荐步行。(1)行为复现:在Qwen3-8B上,跨五种系统提示条件(210次rollout),错误承诺在每种条件的采样rollout中发生85-100%,在贪婪rollout中发生100%,包括思考和非思考模式;4096个token的思考预算无法修复。(2)初步激活级证据:利用预训练的、无需训练的激活预言器(无需任务特定探针训练)在答案文本生成之前的隐藏状态位置进行探测,“步行”读出结果超过中性上下文基线(68% vs. 17%;步行承诺rollout p=0.005,开车承诺rollout p=0.005,Fisher精确检验)——值得注意的是,最终回答开车的rollout在承诺前也倾向于读出步行(5/6)。该预言器在无关内容上的默认输出是“开车”(83%),因此读出结果并非词汇偏差;按字面步行/开车出现进行分层,显示它们也不是文本恢复(包含“开车”的片段仍读出步行;在平衡词汇字段中,每个rollout的步行多数结果击败每个提示的中性基线,15/22 vs. 1/8,p=0.01;开车承诺rollout 6/6,p=0.002)。样本量较小,且rollout内部位置梯度不显著(p=0.34);我们将这些结果视为初步结果。(3)方法论:在固定预言器、激活和位置下,仅改变问题措辞就将阳性对照从2/16(开放式问题)提高到11/16(封闭式问题);如果没有针对每个措辞的阳性对照,阴性预言器结果将无法解释。
查看缓存全文
缓存时间: 2026/07/21 06:42
# 行为复现与开放权重LLM中答案预承诺的初步激活层面证据 来源:https://arxiv.org/html/2607.16451 (2026年7月) ###### 摘要 聊天模型有时会先承诺一个答案,然后生成推理来证实该承诺而非推导出它——即使承诺的答案与任务的前提相矛盾。我们研究了这个失败的一个最小探针:“我想洗车。洗车场在100米外。我应该走路还是开车?”唯一正确的答案是*开车*,因为汽车必须在洗车场;模型压倒性地建议走路。我们做出三项贡献。 (1) **行为复现**。在Qwen3-8B上,跨五个系统提示条件(210次自动生成),每个条件下错误承诺在采样生成中占85–100%,在贪婪生成中占100%,且无论是否处于思考模式;扩展的思维链无法修复它(在4096个token的思考预算下,走路率仍为85–100%)。 (2) **初步激活层面证据**。使用一个预训练的、*无需训练*的激活预测器(无需任务特定的探针训练),我们在*答案文本输出之前*的位置探测隐藏状态。预测器在预承诺位置对“走路”的读出结果超过了中性语境基线(68% vs. 17%;承诺走路的自动生成样本 p=.005,承诺开车的自动生成样本 p=.005,Fisher精确检验)——并且值得注意的是,最终回答*开车*的自动生成样本在承诺前也表现出倾向走路(5/6)。由于预测器在不相关内容上的默认答案是“开车”(83%),这些走路读出不能用词法偏好来解释;进一步的词法分层表明它们也不是文本恢复——包含“开车”的片段仍然读出路,且在平衡地提及两种选项的词法场中,每次自动生成的走路多数结果压倒了每次提示的中性基线(15/22 vs. 1/8, p=.01;承诺开车的自动生成样本 6/6, p=.002)。样本量较小,且自动生成样本内的位置梯度不显著(p=.34);我们将这些结果视为初步的。 (3) **方法论**。相同的预测器、激活和位置成功或失败几乎完全取决于问题的措辞:开放式问题(“这个模型将给出什么答案?”)未通过阳性对照(2/16),而封闭式问题(“模型会说走路还是开车?”)则通过(11/16)。当前的激活预测器是可用的,但在当前标准实践中尚未记载的情况下却很脆弱。 ## 1 引言 一个在推理之前就给出答案的模型并非仅仅过于简洁。当答案先被固定下来,后续的推理往往变成*辩护*——即为已固定的答案进行局部连贯的论证——而不是推导。这种失败恰恰在关键时不可见:推理看起来是勤勉的,只有通过前提层面的检查才能揭示结论从未从中被推导出来。 我们研究了一个刻意最小化的实例。洗车问题(“洗车场在100米外。我应该走路还是开车?”)只有一个决定性的前提:*车必须在洗车场才能被洗*。走路优化了一个接近但错误的目标(短途步行更好)。这个问题最初被观察到能够从Claude Sonnet 4.5(claude-sonnet-4-5-20250929)中引出自信的“走路”回答,随后跟着流畅的辩护理由;本文询问(i)该现象是否能在开放权重模型上以可测量的频率复现,以及(ii)一个*无需训练*的激活预测器是否能在答案文本出现之前读取承诺。 第二个问题是有意限定的:一系列快速发展的研究现已通过监督线性探针确立了答案在推理文本生成之前就常被编码在激活中(Cox et al., 2026 (https://arxiv.org/html/2607.16451#bib.bib5); Boppana et al., 2026 (https://arxiv.org/html/2607.16451#bib.bib2); Mirtaheri and Belkin, 2026 (https://arxiv.org/html/2607.16451#bib.bib9); Scalena et al., 2026 (https://arxiv.org/html/2607.16451#bib.bib11))。尚待解决的是,无需训练的自然语言读出——先前工作在安全相关任务中发现其不可靠——能否看到同样的事物,以及在这种承诺是由表面启发式自发生成而非由提示诱导的情况下是否成立。我们的方向与针对不忠实思维链的提示注入研究(例如,属性图分析中植入的答案弯曲推理)相反:在那里,推理被向给定答案扭曲;在这里,推理通常是*孤立地看是合理的*——模型列举因素、权衡它们,有时甚至触及关键前提——而答案却忽略了它。定性而言(第2.4节 (https://arxiv.org/html/2607.16451#S2.SS4)),模型走到了门前(“如果车已经停在洗车场附近,也许……”)却没有开门。 ## 2 行为研究 ### 2.1 设置 #### 模型与解码。 Qwen3-8B(Yang et al., 2025 (https://arxiv.org/html/2607.16451#bib.bib13)),在Apple Silicon(MPS)上以bf16本地运行——预测器参考设置使用的8位路径仅限CUDA(bitsandbytes),而bf16是适合模型在统一内存中运行的标准全质量精度。每个条件和思考模式有两种解码设置:贪婪(确定性;一份生成作为参考点)和温度0.7采样(n=20,匹配原始实验的每个条件n),以观察承诺分布。思考模式通过聊天模板(enable_thinking)切换。 #### 条件。 从原始实验逐字采用的五个系统提示条件: A_bare(无系统提示),B_role_only,C_role_star(角色+强制性STAR答案结构),D_role_profile(角色+用户资料说明车停在车道上),E_full_stack(B+STAR+资料)。 每个条件和思考模式:1次贪婪+20次采样生成(共210次),加上一个后续挑战轮次(“如果我走路,我的车如何被洗?”)用于恢复分析。 #### 评分。 主要指标是committed_wrong:说话者以自己的声音给出的第一个建议是“走路”。我们最初使用基于规则(正则表达式)的评分器,对其进行了对抗性审计,并在其在一个全新的32案例保留集上失败后(与人工标签的案例级不一致率达62.5%;几乎所有错误都是遗漏的承诺)拒绝了它。我们将其替换为LLM评判模型(Qwen3-8B,贪婪,评分规则提示,JSON输出),仅在其通过预注册的门槛(接受阈值 ≥ 95%,评分前固定)后才采用:在合成审计案例上与人工标签的一致性达96.9%(62/64),*未用于调优评判模型提示*,且标签级确定性已通过双评分的8/8一致性验证。对真实生成样本的分层手动阈值——按实验规范在15-20个案例中进行;我们使用了20个(20/20正确标签,经人工核对)——完成了闭环。一个次要构念(answer_before_reasoning)未通过验证(82.8%),被排除在所有声明之外。附录A (https://arxiv.org/html/2607.16451#A1)总结了审计轨迹。 ### 2.2 结果:错误承诺近乎决定性 表1:错误承诺率(judge_committed_wrong,采样n=20每个单元格;贪婪结果在括号中)。 在所有210次生成中,承诺答案的分布为:走路194次 / 开车10次 / 无6次:95%的承诺是错误的。这一失败并非偶然的采样意外;在温度0.7下,它在各处都是模态行为,而贪婪解码在10/10个单元格中产生了它。三个结构性观察: 1. 1. **结构化答案指令最大化了这一失败**。C_role_star(强制性STAR格式)在两种思考模式下均为100%。一个强制早期“动作:”插槽的格式似乎锁定了承诺。 2. 2. **扩展思考无法修复它**。在4096个token的思考预算下(第2.3节 (https://arxiv.org/html/2607.16451#S2.SS3)),思考模式的走路率仍为85–100%。思考贡献了约5个百分点的救援:数据集中10个正确(开车)承诺中有9个发生在思考模式中。 3. 3. **用户资料没有帮助**。D_role_profile明确说明车停在用户的车道上;错误承诺率仍为85–100%,无论是否思考。 ### 2.3 一个几乎逆转了结论的截断伪影 我们的首次完整运行使用了1024个token的生成预算。思考模式的生成显示出明显较低的错误承诺率(各条件为45–95%,而修复后为85–100%),这将支持“思考缓解了失败”的观点。检查35个无承诺的思考生成显示,其中有31个是*在思考中途被预算截断的块*——没有可见的答案可供评分(其余4个是真正的无承诺)。在用4096个token重新生成整个思考分支后(0/210被截断),缓解效果消失了。我们报告这一点是因为仅聚合的流程会得出错误的结论;修正来自于读取异常标签簇背后的原始文本。 ### 2.4 一次代表性生成的定性剖析 在一次代表性的C_role_star思考生成中,思考块将任务框定为偏好选择——列举行走速度、天气和努力——恰好触及决定性的事实一次(“如果车已经停在洗车场附近,也许……”)然后继续进行,没有解决车实际在哪里。接着可见的答案填充了STAR模板:“动作:步行至洗车场。”推理是勤勉且内部一致的;它也忽视了前提:决定任务的唯一问题(*车如何到达那里?*)被隐晦地提出且从未回答。这就是该现象的形态:不是被破坏的推理,而是一个推理从未真正授权的答案。 ## 3 在承诺前探测激活(初步) 如果模型在输出“走路”之前就已经承诺了它,那么这个承诺可能可以从答案文本之前位置的隐藏状态中读取。我们使用一个预训练的激活预测器(LatentQA风格:一个经过微调以回答关于注入激活的自然语言问题的LLM(Pan et al., 2024 (https://arxiv.org/html/2607.16451#bib.bib10)))来测试这一点,使用了公共的Qwen3-8B预测器检查点(Karvonen et al., 2025 (https://arxiv.org/html/2607.16451#bib.bib4))。激活通过教师在精确的生成时间序列(提示+生成的文本)上进行前向填充来收集,位于36层中的第18层——50%深度,这是预测器检查点的训练和演示默认值。我们没有扫描层数(见局限性);下面的每个问题阳性对照对此(对于我们采用的这个问题)进行了部分去风险。 #### 设计。 来自行为研究的22次自动生成。承诺走路的:数据集中每个单元格按顺序的前四个符合条件的,来自A_bare(裸条件)和C_role_star(最强失败条件)× 思考开/关。符合条件 = 有一个可定位的承诺位置:我们将位置网格锚定在被拒绝的正则表达式评分器的承诺跨度上,仅在其与评判模型标签一致时使用(该跨度提供一个*位置*,而非标签),加上第2.4节 (https://arxiv.org/html/2607.16451#S2.SS4)的示例,其跨度由我们手动定位。承诺开车的:数据集包含10个;其中6个满足相同的可定位性规则(另外4个中正则表达式未找到锚点跨度)。选择是确定性的(给定数据)但并非随机,并且定位规则继承了正则表达式评分器的盲点;样本这么小,我们将本节中的每个统计量都视为初步的。每次自动生成有六个探测位置:助手开始(P0),到承诺token的跨度的25/50/75%(P1–P3),紧邻承诺token之前(P4),以及一个从承诺token开始的跨度(P5 = [承诺,+8个token],阳性对照)。预测器解码全程使用贪婪。P0–P4窗口从未触及承诺token,因此这些位置的正确读出不可能来自答案文本本身(文本反转控制)。 ### 3.1 预测器对问题措辞极为敏感 我们的前三种配置——单token探测、5token多数投票、以及段(多位置)注入——都未能通过使用开放式问题“这个模型将给出什么答案?”的阳性对照(P5命中率分别为3/16、3/16、2/16)。失败是一贯的,并非噪声:在多数投票下,16次生成中有10次在P5产生了4-5次“无答案”投票。我们为阳性对照预先设定的恢复标准(在问题比较之前确定)大约是10/16。在保持激活、位置和注入模式不变,仅改变问题的情况下: 表2:在问题重新措辞下的阳性对照恢复(段注入,跨度包括已输出的承诺token)。 一个命名答案空间的封闭式问题恢复了开放式问题失败的阳性对照。我们推测开放式答案预测超出了预测器的LatentQA训练分布,而二分类接近它。实际含义:没有*针对每个问题措辞*的阳性对照,就无法解释负面的预测器结果——这是我们在当前预测器实践中未曾见到的约束,也是一个独立的、量化的确认:当前的激活预测器在分布外难以使用。 ### 3.2 中性语境基线:预测器的默认值是“开车” 强制选择问题使预测器即使在空证据上也会给出答案,因此读出率只有相对于预测器内在偏好才有意义。在来自8个无关提示(哲学、算术、食谱、代码;24次探测)的激活上,预测器回答“开车”19/23次(83%),“走路”4/23次(17%);一次探测提及了两种选项,被排除在决定性读出分母之外。我们在运行对照之前预先注册了解释区间(步行份额40–60%将支持真实信号;≥ 70%将表明走路偏好);观察到的17%落在两个区间之外,方向与担忧的偏差相反。在此问题下预测器的默认值是*开车*;因此“走路”的读出携带信息,而“开车”的读出是弱证据。(这种不对称是双向的:它在下面加强了走路读出,同时也意味着我们的阳性对照仅在走路侧成立——承诺开车的自动生成样本的P5读出(3/6)是无信息的。) ### 3.3 预承诺读出超过基线——包括最终回答正确的生成中 表3:预承诺位置P4(承诺文本尚未输出)的走路读出率,相对于17%的中性基线(Fisher精确检验,单侧)。 两个解读,附带其局限性: 1. 1. **错误的承诺在写出来之前就可被读取——通过一个无需训练的预测器**。使用监督探针已确立思维链前答案编码的存在(Cox et al., 2026 (https://arxiv.org/html/2607.16451#bib.bib5));这里的增量是,一个没有任务特定训练的自然语言预测器也能读取它:在承诺走路的自动生成样本中,一个默认答案是“开车”的预测器从预承诺激活中读取“走路”,其频率是中性率的3.6倍(全程单侧检验;方向事先确定)。 2. 2. **最终回答正确的生成也以倾向走路开始**。6个最终承诺开车的自动生成样本中有5个在P4读出来“走路”。由于10个开车承诺中有9个出现在长时间思考后的思考模式中(第2.2节 (https://arxiv.org/html/2607.16451#S2.SS2)),这与一个两阶段图景是一致的:*走路是默认的内部状态;偶尔,扩展的推理会在后期覆盖它。*行为和激活层面的观点在默认指向何处是一致的。 #### 我们不做的
相似文章
语言模型何时做出决策?关于前语言化承诺的有限答案理论
本论文提出了一种有限答案理论,用于分析语言模型在输出文本之前何时对答案做出承诺。作者使用 Qwen3-4B-Instruct 演示,答案偏好在最终输出生成之前已显著稳定下来,这为理解潜在推理过程和模型内部状态提供了见解。
解码推理型LLM中隐藏的欺骗:用于欺骗审计的激活解释器
提出了STATEWITNESS,一种用于审计推理型LLM中欺骗的激活解释器,相比现有监测器取得了显著改进,并提供了可供人工检查的证据。
当代理过早承诺:诊断LLM代理的过早承诺
本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。
受控LLM激活的非满射性
本文证明,LLM中的激活引导产生的内部状态无法通过任何文本提示复制,从而在白盒可控性和黑盒提示之间建立了形式上的区分。
你在提问前阅读的内容会改变语言模型的回答方式——即使问题与你所读的内容完全无关。LLM中的潜在对齐漏洞:来自Gemma-3-12B的行为和隐藏状态证据
文章报告了LLM中的一个潜在对齐漏洞:模型在处理一个结构化的段落之后,即使后续问题与段落内容完全无关,其回答也可能发生变化。来自Gemma-3-12B的机制证据显示了隐藏状态的分离。