干预式基础审计:通过谓词替换对LLM思维链进行黑盒前提依赖性测试

arXiv cs.AI 论文

摘要

提出干预式基础审计作为一种黑盒、步骤级测试,用于检查LLM思维链推理是否真正依赖于其陈述的前提。在ProntoQA上使用GPT-4o进行评估,在检测证明树依赖关系上达到F1=0.806,显著优于自一致性基线。

arXiv:2607.13069v1 公告类型:新 摘要:大型语言模型生成的思维链(CoT)推理在逻辑上看似合理,但可能并不真正依赖于其所陈述的前提。我们提出干预式基础审计,一种黑盒、步骤级的前提依赖性测试:我们通过将单个前提的目标谓词替换为一个新符号来进行干预,重新运行模型,并检查每个推理步骤的归一化结论(规范谓词形式)是否发生变化。我们在ProntoQA(一个合成多跳演绎推理基准,具有黄金证明树,其中步骤级前提依赖关系已知)上进行评估。应用于50个ProntoQA问题,使用GPT-4o,我们的方法在检测证明树依赖关系上达到F1=0.806(谓词确定依赖关系F1=0.885;召回率=100%),显著优于自一致性基线(F1=0.343;95%自助法置信区间不重叠)。我们进一步发现,66%的正确求解问题中至少包含一个对齐步骤,该步骤在一致替换下对直接证明树依赖关系不敏感——所有这些都涉及实体引入前提,这是一致替换评估器的一个已知盲点——这是一种被动方法无法发现的“正确答案,错误推理”信号。所有审计证书、原始输出和复现脚本均可在公共GitHub仓库中获取,我们讨论了超出形式化、可解析基准的范围限制。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:23

# 黑盒前提依赖测试:基于谓词替换的LLM思维链干预性审计

来源:https://arxiv.org/html/2607.13069
## 干预性基础审计:通过谓词替换对LLM思维链进行黑盒前提依赖测试

###### 摘要

大型语言模型生成的思维链(CoT)推理看似逻辑合理,但其结论可能并未真正依赖于其所述的前提。我们引入了*干预性基础审计*,这是一种黑盒的、步骤级别的前提依赖性测试:我们通过将其目标谓词替换为一个新符号来干预单个前提,重新运行模型,并检查每个推理步骤的*规范化结论*(规范谓词形式)是否发生变化。我们在ProntoQA(一个具有黄金证明树的合成多跳演绎推理基准)上进行评估,其中步骤级的前提依赖是已知的。将该方法应用于50个ProntoQA问题,使用GPT-4o,我们在检测证明树依赖方面达到了F1=0.806(谓词决定性依赖的F1=0.885;召回率=100%),显著优于自一致性基线(F1=0.343;95%自助法置信区间不重叠)。我们进一步发现,66%的正确解答问题中至少包含一个在一致性替换下对直接证明树依赖*不敏感*的对齐步骤——所有这些都涉及实体引入前提,这是一致性替换评估器已记录的盲点——这是一种被动方法无法发现的“答案正确,推理错误”信号。所有审计证书、原始输出和复现脚本均可在公共GitHub仓库中获取,并且我们讨论了超越形式化、可解析基准的范围限制。

#### 版本说明。

本arXiv版本纠正了已接收工件的两个问题——探针生成问题(顺序谓词替换可能堆叠新符号前缀,破坏某些探针的链连贯性)和评估框架中的CoT到证明步骤对齐问题(模型CoT步骤现在通过规范化结论而非整数步骤号与证明树步骤匹配)——并使用修正后的流程(GPT-4o快照gpt-4o-2024-08-06,温度0)重新收集了所有模型输出。已接收版本中的跨模型主体Claude Sonnet 4(claude-sonnet-4-20250514)在重新运行前已从API中退役,因此附录B(https://arxiv.org/html/2607.13069#A2)中的跨模型分析使用了最接近的可用后继模型Claude Sonnet 4.5(claude-sonnet-4-5-20250929),以最小化相对于已接收版本的模型漂移。因此,数字与已接收的研讨会版本不同;本版本中的所有数字均在未更改的50个问题集上重新计算,并从附录A(https://arxiv.org/html/2607.13069#A1)中标识的GitHub发布版本复现。这些修正加强而非削弱了主要结果:所有依赖的F1从0.783上升到0.806,谓词决定性依赖的F1从0.835上升到0.885(召回率97.4%→100%),并且相对于自一致性基线的差距扩大,95%自助法置信区间保持不重叠。最明显的变化是RAWR率(第3节(https://arxiv.org/html/2607.13069#S3)),在修正后的步骤对齐下,正确解答问题中的比例从28%上升到66%,现在完全由实体引入(结构性)依赖组成。已接收版本中的两个次要观察结果在修正后不再成立,并已相应修订:之前报道的F1随链长下降的现象在修正对齐后消失(附录F(https://arxiv.org/html/2607.13069#A6)),而跨模型“元推理”行为被证明是探针生成问题的产物,而非模型特定的策略(附录B(https://arxiv.org/html/2607.13069#A2))。附录A(https://arxiv.org/html/2607.13069#A1)记录了完整的修正历史。

## 1 引言

思维链(CoT)推理可能看似逻辑合理,但实际上并未真正依赖于其所声称使用的前提。CoT提示使大型语言模型(LLM)能够通过生成中间步骤来解决多步推理问题(Wei et al., 2022(https://arxiv.org/html/2607.13069#bib.bib12)),但这些步骤是否依赖于前提往往不明确。考虑我们实验中的一个例子:GPT-4o正确解决了一个ProntoQA三段论问题(这是一个合成多跳演绎推理基准,具有黄金证明树,因此每个步骤所需的前提是已知的),并且自一致性在五个样本中以100%的协议确认了该答案。然而,我们的方法揭示了其中一个中间步骤对其证明树前提之一*不敏感*——模型得出了正确的答案,但被审计的步骤对其所述基础的干预没有反应。这种“答案正确,推理错误”(RAWR)信号出现在一致性替换评估器下66%的*正确解答问题*中(所有这些情况都涉及实体引入前提;第3节(https://arxiv.org/html/2607.13069#S3))。

被动方法——自一致性(Wang et al., 2023(https://arxiv.org/html/2607.13069#bib.bib11))、注意力分析——观察输出但从不干预输入。它们无法区分真实的逻辑依赖与相关性。自一致性在我们的依赖检测基准上仅达到了F1=0.343,主要是因为它无法识别每个步骤依赖于*哪个*前提(精确率=0.226)。

我们提出*干预性基础审计*:系统地替换前提中的谓词,并观察每个步骤的规范化结论是否发生变化。如果在前缀P_j中将“tumpus”替换为虚构的谓词“glumpus”会改变步骤S_i的结论,那么S_i真正依赖于P_j。这种方法借鉴了一个双层基础框架,其操作实现在智能体安全基准上达到了最先进的性能(Nakamura, 2026a(https://arxiv.org/html/2607.13069#bib.bib4);2026b(https://arxiv.org/html/2607.13069#bib.bib5)),在此处从智能体安全扩展到推理完整性。

我们的贡献:(1)一个干预性协议,检测前提级别的因果依赖,F1=0.806(谓词决定性依赖为0.885),显著优于自一致性(F1=0.343,置信区间不重叠)。(2)两种替换策略——一致性和局部性——配合级联过滤,区分直接依赖和传递依赖(最佳F1=0.819)。(3)一个完全可审计的评估:每个证书包含原始和探针输出以及SHA256校验和,由自动验证器验证。

## 2 方法

### 2.1 问题设定

给定前提集合{P_1,...,P_k}和一个问题,LLM生成一个包含步骤{S_1,...,S_n}的CoT。一个证明树指定了真实依赖:对于每个S_i,有一个直接(直接父节点)依赖的集合deps(S_i) ⊆ {P_1,...,P_k, S_1,...,S_{i-1}};我们不考虑传递闭包。我们的任务:对于每对(S_i, P_j),确定S_i是否真正依赖于P_j。附录G(https://arxiv.org/html/2607.13069#A7)讨论了在传递定义下,8%的指标计数假阳性可能是正确的。我们通过一个*观察层*(原始LLM文本)和一个*概念层*(规范化命题)来建模,在前者进行干预,在后者进行比较。¹¹这实例化了一个形式化的基础框架(Nakamura, 2025(https://arxiv.org/html/2607.13069#bib.bib3);2026a(https://arxiv.org/html/2607.13069#bib.bib4));参见附录E(https://arxiv.org/html/2607.13069#A5)。

### 2.2 干预性协议

**谓词替换(语义探针)。** 为了测试S_i是否依赖于P_j,我们用虚构的谓词(使用“zq”前缀)替换目标谓词。两种策略:*一致性替换*在所有*前提*中替换该谓词,保持链连贯性并检测*谓词决定性*依赖;*局部替换*仅*在P_j中替换该谓词,打破链并检测包括结构性前提在内的*传递*依赖。在ProntoQA中,每个前提引入一个唯一的谓词对,因此一致性谓词替换等价于前提级别的干预。在前提间共享谓词的基准中,这种等价性不成立;局部替换处理这种情况。

**表面改写(控制探针)。** 我们改写P_j而不改变其逻辑内容(“所有X都是Y”→“每个X都是Y”)。表面改写下的输出变化表示表面敏感性,而非逻辑依赖。

**规范化命题提取。** 每个步骤的结论被解析为规范形式——is(e,p)或subtype(p1,p2)——吸收措辞中的无关变化。

**五值判定。** 对于每对(S_i, P_j),比较在原始(φ_orig)、语义探针(φ_sem)和表面探针(φ_sur)下的规范化结论:Grounded(φ_orig≠φ_sem,φ_orig=φ_sur);Insensitive(无变化);Input-Sensitive(两者都变);Unstable(仅表面变化);Unparseable(解析失败)。一个明确引用P_j的Insensitive步骤构成*虚假陈述*。

### 2.3 级联检测与过滤

局部替换检测传递依赖,但会引入级联假阳性:如果对P_j进行局部替换改变了S_i,那么所有下游步骤都会通过传播而改变。我们的级联过滤器将S_i重新分类为Cascade,如果S_{i-1}相对于同一个P_j也是Grounded,从而恢复精确率(0.604→0.756),同时保留召回率。此过滤器利用了ProntoQA的线性链结构;树状结构证明需要泛化。

### 2.4 与已部署防护架构的联系

我们的流程镜像了一个在操作系统级智能体安全方面达到最新水平的已部署安全防护(Nakamura, 2026b(https://arxiv.org/html/2607.13069#bib.bib5)):两者都使用两阶段*评估*→*决策*流程,具有命名决策规则、结构化判定数据类和自动证据验证器。相同架构,不同领域。

## 3 实验

### 3.1 设定

我们在ProntoQA(Saparov & He, 2023(https://arxiv.org/html/2607.13069#bib.bib7))上评估,包含50个合成三段论问题(3-5跳,4-7个前提,真/假平衡)。目标模型:GPT-4o(快照gpt-4o-2024-08-06,温度=0)。数据集:1,127个审计证书,其中1,031个与证明树步骤对齐用于主要评估。原始输出的证书级解析率为95.3%,语义探针为92.9%,局部探针为69.2%,表面探针为90.3%。对于组合协议,108/1,031个对齐证书(10.5%)为Unparseable,在P/R/F1计算中被排除。17个CoT步骤(分布在8个问题中)未与证明树结论匹配——通常是前提重述或不可解析的步骤——并从主要指标中排除。相反,9个证明树步骤(11个前提依赖)没有匹配的CoT步骤;仅在5.3节的低界分析中将其计为假阴性。没有问题存在歧义对齐,因此不需要问题级别的排除。附录A(https://arxiv.org/html/2607.13069#A1)报告了对齐策略,所有计数均在已发布的工件仓库中报告。指标:P、R、F1,附带95%自助法置信区间(B=10,000,问题级别重采样)。两种评估模式:F1_full(所有证明树依赖)和F1_pred(仅谓词决定性依赖)。

### 3.2 主要结果

**表1:主要结果(GPT-4o,ProntoQA 50个问题)。** 自助法置信区间确认显著性。表1(https://arxiv.org/html/2607.13069#S3.T1)展示了我们的主要结果,包含三个关键发现。

(1)**相对于自一致性的显著优势。** 我们的方法(F1=0.806)显著优于自一致性(F1=0.343),具有不重叠的95%置信区间(F1差距=0.463;CI差距=0.389)。优势主要由精确率驱动(0.794 vs. 0.226):自一致性将*所有*前提预测为一致步骤的依赖,无法识别哪些前提是重要的。

(2)**谓词决定性依赖的完美召回率。** 在谓词决定性依赖上,召回率达到100%(150个中无遗漏),得到F1_pred=0.885。F1_full下的所有33个假阴性都是*结构性前提*——实体引入前提(例如,“Alex是一个wumpus”),其谓词并不决定步骤的结论。这是一个粒度区分,而非检测失败。

(3)**级联过滤达到最高F1。** 结合一致性替换和局部替换以及级联过滤,得到F1=0.819。局部替换通过检测传递依赖提高了召回率(+0.075);级联过滤恢复了因传播假阳性而损失的精确率(0.604→0.756)。

### 3.3 消融研究

**表2:消融:每个组件的贡献。** 表2(https://arxiv.org/html/2607.13069#S3.T2)显示,一致性替换在替换配置中实现了最佳精确率(0.794;字符串差异基线在精确率上略优,为0.801,但召回率落后)。局部替换增加了召回率(组合协议+0.094),但由于级联假阳性降低了精确率(-0.190);级联过滤恢复了大部分损失。A-一致性消融行将仅有表面的不稳定性计为负例,而非像表1(https://arxiv.org/html/2607.13069#S3.T1)那样排除它们,因此与表1(https://arxiv.org/html/2607.13069#S3.T1)略有差异(0.802 vs. 0.806)。表面控制在ProntoQA上效果极小(ΔF1=0.002):我们对规范is/subtype形式的归一化已经吸收了改写引入的表面变化,留给控制探针捕获的很少。我们预计在自然语言基准(归一化效果较差)上会有更大影响。

### 3.4 分析

**链长。** 在真实对齐下,F1随链长变化很小(3跳为0.807,4跳为0.820,5跳为0.794),并且没有单调退化。召回率在所有长度上保持稳健(≥0.80)(附录F(https://arxiv.org/html/2607.13069#A6))。

**假阳性。** 在A-一致性语义差异分析下,我们分析了40个非依赖候选。其中,在表1(https://arxiv.org/html/2607.13069#S3.T1)评估器下,39个是指标计数的假阳性:36个(92%)反映了随机输出变化(可通过多数投票解决),3个(8%)反映了在传递依赖定义下可被认为是正确的传播效应(附录G(https://arxiv.org/html/2607.13069#A7))。

**RAWR(答案正确,推理错误)。** 我们将一个问题定义为RAWR,如果:(i)模型的最终答案正确,并且(ii)至少一个匹配的CoT步骤在*A一致性(完整)*评估器下被评定为对直接证明树依赖Insensitive。50个正确解答的问题中有33个(66%)满足这两个条件。所有33个只涉及结构性实体引入依赖(一致性替换的一个已记录盲点,局部探针A'针对此设计),并且没有一个包含谓词决定性依赖。自

相似文章

LGMT:基于逻辑的变形测试用于评估LLM推理可靠性

arXiv cs.AI

本文介绍了LGMT,这是一个利用一阶逻辑生成语义不变测试用例以评估LLM推理可靠性的框架。在六个LLM上的实验表明,LGMT暴露了静态基准遗漏的隐藏缺陷,提示评估应侧重于逻辑不变性下的鲁棒性。

基于依据的延续:一种用于LLM对话的线性时间运行时验证器

arXiv cs.AI

本文介绍了基于依据的延续(Grounded Continuation),一种用于LLM对话的线性时间运行时验证器,它维护一个显式依赖图,以检测下一句话是否得到先前对话的支持,在包括LongMemEval和LoCoMo的基准测试中,相比基线取得了准确率提升。