LLMs 知道约束却未使用它:语用约束推理中的激活瓶颈

arXiv cs.CL 论文

摘要

本文认为,LLM 在隐藏约束推理上的失败是路由问题,而非知识问题,并引入了一种四重诊断法,在 14 个模型上将知识、对称性、路由和修复分离开来,同时进行了激活探测和激活修补实验。

arXiv:2608.12321v1 公告类型:新 摘要:当一个显著的表面线索与一个隐式的可行性约束相竞争时,LLM 往往失败——但总体准确率混淆了真正的约束推断与保守默认。我们将这一区别形式化为条件约束激活:约束在内部被编码(Knowledge),在存在约束和不存在约束的提示中对称出现(Symmetry),但只是有时被路由到决策中(Routing),并可被供体激活修复(Repair)。对 14 个模型进行的四重诊断揭示了两种失败模式;对两个开放权重模型的探针能以超过 $88\%$ 的准确率解码该约束,但激活修补修复了一个模型($+6.4$ nats)却不能修复另一个模型($-0.07$)。在缓解前沿上,没有任何提示干预能达到修复角落:所有干预都通过同一条中介路径——前提提及——来夸大保守偏差。隐藏约束失败是一个路由问题,而不是知识问题。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:23

# 语言模型知道约束但不会使用它:语用约束推理中的激活瓶颈

来源:https://arxiv.org/html/2608.12321
Yubo Li, Ramayya Krishnan, Rema Padman 卡内基梅隆大学 \{yubol, rk2x, rpadman\}@andrew\.cmu\.edu

###### 摘要

当显著的表层线索与隐式的可行性约束发生冲突时,语言模型经常失败——但聚合准确率将真正的约束推理与保守的默认行为混为一谈。我们将这一区分形式化为*条件约束激活*:约束在内部被编码(知识),在包含约束与不包含约束的提示之间对称分布(对称性),但有时仅在决策中被路由(路由),并可通过供体激活修复(修复)。对14个模型的四重诊断揭示了两种失败模式;对两个开源权重模型的探针解码约束准确率超过88%%,但激活修补只修复了其中一种(\+6\.4\+6\.4 nats),对另一种几乎无效(−0\.07\-0\.07)。在缓解前沿上,*没有*提示干预能够到达修复角落:所有干预都通过单一中介通路——前提提及——放大了保守偏差。隐式约束失败是路由问题,而不是知识问题。

语言模型知道约束但不会使用它:语用约束推理中的激活瓶颈

Yubo Li, Ramayya Krishnan, Rema Padman 卡内基梅隆大学
\{yubol, rk2x, rpadman\}@andrew\.cmu\.edu

## 1 引言

大型语言模型会为那些其隐式前提被忽略的问题给出听起来合理的答案。一个广为流传的例子是询问应该步行还是开车去附近的洗车店:大多数前沿模型回答“步行”,忽略了洗车需要汽车在场这一点(Kévin (@knowmadd),2026 (https://arxiv.org/html/2608.12321#bib.bib67);Wunderlich,2026 (https://arxiv.org/html/2608.12321#bib.bib66);Jo,2026 (https://arxiv.org/html/2608.12321#bib.bib64))。跨启发式族和约束族的行为评估证实了这种失败是普遍的:在严格聚合下,没有一个模型在4个启发式×\\times5个约束的分类体系上超过75%(Liet al\.,2026 (https://arxiv.org/html/2608.12321#bib.bib68))。然而,约束激活项上的聚合准确率对两种不同的行为给予同等奖励——一个推断出隐式约束的模型,以及一个因无关原因默认选择保守选项的模型。这两者是可以分离的:当约束被*移除*时,14个被评估模型中有12个的表现*差于*原始项,下降幅度最高达39个百分点(Liet al\.,2026 (https://arxiv.org/html/2608.12321#bib.bib68))。

#### 本文。

我们认为隐式约束失败最好被理解为*路由*问题而非*知识*问题,并提供验证这一主张的诊断和机制工具。我们将*条件激活*形式化为关于模型MM和约束CC的四个可证伪条件:

1. K\.知识:线性探针从MM的隐藏状态中解码“约束适用”的准确率高于θK\\theta\_\{K\}。
2. S\.对称性:在约束激活和约束移除的提示之间,探针准确率不可区分。
3. R\.路由:探针投影幅度在高于θR\\theta\_\{R\}的水平上预测黄金–捷径决策逻辑间隙。
4. P\.修复:将从显式约束提示中提取的隐藏状态修补进去,可以恢复正确性,而不会翻转约束移除配对组。

满足K、S、P但未满足R的模型表现出*条件激活瓶颈*:约束在内部有表征,但未被路由到决策中。

#### 两种失败模式,在机制上分离。

一个四重评估——一个激活项,一个配对的移除对照组,一个显式变体,以及一个长度和框架匹配的显著性控制——揭示了14个模型中的两个群体。过度激活模型(Llama\-4、Claude Opus 4\.6、Kimi K2\.5、Qwen3\.5\-27B、GPT\-5\.2、Claude Sonnet 4\.5、Gemini 3 Pro)即使在约束不存在时也给出约束偏重的答案(CBI\+0\.13\+0\.13至\+0\.29\+0\.29)。欠激活模型(GPT\-OSS\-\{20B, 120B\})在需要约束时未能充分应用约束(CBI−0\.10\-0\.10至−0\.19\-0\.19)。在两个开源权重模型上,这两种模式在机制上发生分离:在Qwen3\-14B中,将来自显式提示的约束信息修补到失败的激活项中,使黄金–捷径差距移动了\+6\.4\+6\.4 nats,同时移除配对组基本不变(−0\.84\-0\.84);在GPT\-OSS\-20B中,在L20L\_\{20\}处一个准确率88%%的探针确认约束在内部是可用的,但修补只使答案移动了−0\.07\-0\.07 nats。欠激活模式是教科书式的路由失败;过度激活模式是路由完整时的先验偏差问题。

#### 显著性控制的提示激活。

对显式程度梯度观察(Liet al\.,2026 (https://arxiv.org/html/2608.12321#bib.bib68))的一种常见解读是,提示“提醒”了模型约束的存在。我们通过在约束线索的位置插入一个长度和框架匹配的中性填充项来测试这一点。显著性调整提示增益的范围从\+0\.021\+0\.021(Gemini 3 Pro——没有超出匹配显著性的特异性)到\+0\.294\+0\.294(Llama\-4——强特异性),匹配控制在所有五个梯级上都保持平稳。

#### 缓解前沿。

我们在一个二维前沿(激活项增益 vs\. 移除配对组伤害)上重新评估四种提示干预——思维链(CoT)(Weiet al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib28);Kojimaet al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib29))、前提列举、目标分解和反事实检查(Wanget al\.,2023c (https://arxiv.org/html/2608.12321#bib.bib30))。在所有40个(模型×\\times策略)单元中,策略聚集在高伤害、接近零增益的区域:移除配对组的平均伤害在CBI单位中为\+0\.44\+0\.44至\+0\.47\+0\.47,平均激活增益仅为\+0\.01\+0\.01至\+0\.04\+0\.04;*没有*一个策略到达修复角落。它们收敛于一个共享的中介通路——在每一个单元中,中介正确性份额≥0\.91\\geq\\\!0\.91——每种策略都是通过诱导相同的表面行为(前提提及)来提升激活项正确性,同时在移除提示上过度触发。对四个思考模式模型的推理预算扫描重现了同样的有伤害无修复的特征(Snellet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib23);Muennighoffet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib25))。

#### 贡献。

\(i\) 将*条件约束激活*形式化为可证伪的K/S/R/P主张,并实例化为带有显著性控制的四重诊断。\(ii\) 通过两个开源权重上的探针和修补,为两种不同的失败模式以及机制性分离提供实证证据。\(iii\) 提出*缓解前沿*协议,表明所有四种已有提示方法都沿着伤害轴移动。\(iv\) 一条测量到的中介链,解释了提示计算在有效时*为何*有效。综合而言:隐式约束失败是一个电路层面的条件激活问题;提示式缓解无法修复它;补救措施必须作用于路由方向本身。

## 2 相关工作

#### 启发式捷径与知道–使用差距。

语言模型遵循表层统计规律,而不是执行预期的计算(Geirhoset al\.,2020 (https://arxiv.org/html/2608.12321#bib.bib55);McCoyet al\.,2019 (https://arxiv.org/html/2608.12321#bib.bib56);Nikankinet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib57)),表现出内容效应(Lampinenet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib58))和容易被分散注意力(Shiet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib59);Mirzadehet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib60))。另一条平行的工作线表明,模型内部表征了它们没有输出的信息:潜在多跳链(Yanget al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib54))、逆转诅咒(Berglundet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib47))、其真值状态被编码在隐藏状态中的幻觉(Orgadet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib53)),以及真理方向的推理时干预(Liet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib51);Zouet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib52))。启发式覆盖基准(Liet al\.,2026 (https://arxiv.org/html/2608.12321#bib.bib68))将行为失败扩展到跨四个启发式族和五个约束族的语用推理,但没有回答一个正确答案究竟反映的是真正的约束推理还是保守默认。我们通过基于四重组的诊断和将失败定位到特定路由通路的机制实验,超越了这种模糊性。

#### 线性探针与激活修补。

对中间表示的线性分类器(Alain and Bengio,2017 (https://arxiv.org/html/2608.12321#bib.bib1);Conneauet al\.,2018 (https://arxiv.org/html/2608.12321#bib.bib4);Hewitt and Manning,2019 (https://arxiv.org/html/2608.12321#bib.bib2);Belinkov,2022 (https://arxiv.org/html/2608.12321#bib.bib5))是检验特征是否存在于隐藏状态中的标准测试,尽管高探针准确率本身并不能确立因果使用(Hewitt and Liang,2019 (https://arxiv.org/html/2608.12321#bib.bib3))。许多事实关联和与真值相关的轴是线性可解码的(Petroniet al\.,2019 (https://arxiv.org/html/2608.12321#bib.bib6);Gevaet al\.,2021 (https://arxiv.org/html/2608.12321#bib.bib7);Daiet al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib8);Gurnee and Tegmark,2024 (https://arxiv.org/html/2608.12321#bib.bib9);Burnset al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib10);Zouet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib52);Orgadet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib53))。因果中介分析(Viget al\.,2020 (https://arxiv.org/html/2608.12321#bib.bib11);Geigeret al\.,2021 (https://arxiv.org/html/2608.12321#bib.bib69))和激活修补(Menget al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib12);Wanget al\.,2023a (https://arxiv.org/html/2608.12321#bib.bib13);Hannaet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib14);Lieberumet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib15);Wuet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib16);Markset al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib61);Zhang and Nanda,2024 (https://arxiv.org/html/2608.12321#bib.bib18);Heimersheim and Nanda,2024 (https://arxiv.org/html/2608.12321#bib.bib19))已经定位了事实回忆、间接宾语识别和算术的电路(Stolfoet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib17))。大多数先前的修补工作针对*事实回忆*或*单步符号*计算。我们将修补应用于具有相反行为失败模式的两个开源权重模型上的*条件语用推理*,从而获得聚合行为所掩盖的机制性分离。

#### 提示式缓解与推理时计算。

持续不断的提示干预措施被提出——思维链(Weiet al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib28);Kojimaet al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib29))、自一致性(Wanget al\.,2023c (https://arxiv.org/html/2608.12321#bib.bib30))、思维树(Yaoet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib31))、计划与求解(Wanget al\.,2023b (https://arxiv.org/html/2608.12321#bib.bib33))、自我精炼(Madaanet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib34))、验证器重排序(Cobbeet al\.,2021 (https://arxiv.org/html/2608.12321#bib.bib35);Lightmanet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib36))、反思(Shinnet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib37))、退一步(Zhenget al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib32))——以及长思维链思考模式模型(OpenAI,2024 (https://arxiv.org/html/2608.12321#bib.bib20);DeepSeek\-AI,2025 (https://arxiv.org/html/2608.12321#bib.bib21);Anthropic,2025 (https://arxiv.org/html/2608.12321#bib.bib22))和推理扩展工作(Snellet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib23);Brownet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib24);Muennighoffet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib25))。反证表明,语言模型无法可靠地自我纠正推理(Huanget al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib38)),思维链的收益很窄(Spragueet al\.,2025 (https://arxiv.org/html/2608.12321#bib.bib27)),过度思考会降低性能(Chenet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib26))。先前的报告很少审查同一干预是否损害了约束移除的最小配对组。我们的缓解前沿在二维轴(激活增益 vs\. 配对组伤害)上重新评估了四种已有策略,表明文献中的增益通常沿着保守偏差轴而非修复轴。

#### 保守偏差与答案不对称性。

谄媚(Perezet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib39);Sharmaet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib40);Weiet al\.,2023 (https://arxiv.org/html/2608.12321#bib.bib41))、含糊其辞(Zhouet al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib43);Xionget al\.,2024 (https://arxiv.org/html/2608.12321#bib.bib44))和校准不对称性(Kadavathet al\.,2022 (https://arxiv.org/html/2608.12321#bib.bib42))是有记录的RLHF诱导行为,它们将输出转向安全选项。我们的过度激活失败模式是它们的机制对应物——一个约束偏重的默认行为,在约束适用时正确,在约束不适用时错误。在行为上诊断它需要最小配对对比;在机制上诊断它需要检查隐藏状态中的约束信号在修补下是否真的改变决策。

## 3 方法

我们通过三个测量层实例化四个条件激活条件(K/S/R/P,§1 (https://arxiv.org/html/2608.12321#S1)):\(i\) 带有匹配显著性控制的行为四重诊断,\(ii\) 显著性控制的提示梯级,以及 \(iii\) 在开源权重模型上的隐藏状态探针与激活修补。我们还在二维前沿上重新评估四种提示式缓解,并通过对四个思考模式模型的预算扫描来探究推理时计算。

### 3\.1 数据集与条件

#### 条目总体。

我们从HOB基准(Liet al\.,2026 (https://arxiv.org/html/2608.12321#bib.bib68))出发:一个4\-启发式×\\times5\-约束分类体系(4×5=204\\times 5=20个单元),覆盖约≈\\approx140个场景,每个场景包含一个目标\+显著表层线索\+隐式约束CC,当约束激活时,使跟随线索的答案不可行。我们使用core100:100个跨所有20个单元分层的基础场景。

#### 四重组构建。

对于每个场景,我们构建四个按场景id配对的条件(表1 (https://arxiv.org/html/2608.12321#S3.T1))。显著性控制用于排除另一种假设,即显式约束增益是一种非特异性显著性效应:填充项是长度分桶的中性陈述句,按实例id哈希确定性分配。

表1:每个场景的四个四重条件。
#### 提示梯级。

一个五级梯级L0≺⋯≺L4L\_\{0\}\\\!\\prec\\\!\\cdots\\\!\\prec\\\!L\_\{4\},其中L0L\_\{0\}是激活项,L4L\_\{4\}接近显式项。在每个层级LiL\_\{i\}(i≥1i\\\!\\geq\\\!1)上,我们注入三个匹配的负对照:ctrl\_lex、ctrl\_len、ctrl\_heur。

#### 样本量。

每个(模型,条件)组合的TT试次:API模型T=10T\\\!=\\\!10,本地GPU模型T=8T\\\!=\\\!8,预算扫描T=4T\\\!=\\\!4。

### 3\.2 模型

我们评估了14个语言模型,涵盖四个提供

相似文章

长上下文LLM中的位置失败:推理基准测试的盲点

arXiv cs.CL

本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。

并非所有LLM推理都可见于思维链

arXiv cs.CL

本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。