推理一致性扫描:用于审计AI安全评估中思维链有效性的框架
摘要
本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。
arXiv:2607.07229v1 Announce Type: new
摘要:先前的研究表明,思维链(CoT)推理通常是不忠实的:模型陈述的推理并不能可靠地反映其产生输出的过程。然而,检测不忠实性需要受控的实验干预,这无法事后应用于评估记录。我们转而关注一个更易于处理且较少受到关注的问题:所陈述的推理是否与其附带的答案在逻辑上一致。与忠实性不同,一致性仅凭记录即可评估,无需任何干预。我们引入了推理一致性扫描,一种在AI安全评估记录中检测该属性的可复用方法。我们的贡献有四个方面。首先,我们将推理一致性与忠实性区分开,并定义了六种不一致性子类型。其次,我们构建了一个经过验证的60条记录基准,这些记录是根据InstrumentalEval输出手动改编的。第三,我们为InspectScout实现了一个可工作的扫描器,这是首个针对安全评估记录中该属性的扫描器。第四,我们报告了来自inspect_evals的四个生成模型和三个评估的结果,表明推理不一致性存在、可检测,并且跨模型和任务类型系统性地变化。
查看缓存全文
缓存时间: 2026/07/09 07:56
# AI安全评估中思维链有效性审计框架 来源:https://arxiv.org/html/2607.07229 ## 推理一致性扫描:AI安全评估中思维链有效性审计框架 ###### 摘要 已有研究表明,思维链(CoT)推理通常并不忠实:模型陈述的推理过程并不能可靠地反映其产生输出的实际过程(Turpin 等,2023 (https://arxiv.org/html/2607.07229#bib.bib1);Lanham 等,2023 (https://arxiv.org/html/2607.07229#bib.bib2);Chen 等,2025 (https://arxiv.org/html/2607.07229#bib.bib3);Walden 和 Wanner,2026 (https://arxiv.org/html/2607.07229#bib.bib4))。然而,检测不忠实性需要受控实验干预,而这些方法无法事后应用于评估记录副本。我们转而关注一个更易处理但较少被关注的问题:陈述的推理与其所伴随的答案在逻辑上是否*一致*。与忠实性不同,一致性可以仅凭记录副本进行评估,无需任何干预。我们引入推理一致性扫描,这是一种可重复使用的方法,用于在AI安全评估记录副本中检测这一属性。我们的贡献有四点。首先,我们将推理一致性与忠实性区分开来,并定义了一个包含六种子类型的不一致性分类体系。其次,我们构建了一个包含60个记录副本的经过验证的基准数据集,该数据集基于 InstrumentalEval 的输出进行人工改编。第三,我们为 InspectScout 实现了一个可运行的扫描器,这是首个针对安全评估记录副本中该属性的扫描工具。第四,我们报告了跨四个生成模型和三个来自 `inspect_evals` 的评估任务的结果,表明推理不一致性确实存在、可以被检测到,并且随着模型和任务类型的不同而系统性地变化。111代码、基准数据集和扫描器可在 https://github.com/SilviaSantano/Reasoning-Consistency-Scanner 获取。 ## 1 引言 思维链推理已成为解读AI安全评估的核心方式。当测试模型是否具有危险能力、欺骗行为或对齐相关行为时,评估者不仅关注模型输出了什么,还日益关注模型如何推理任务。推理痕迹被视为模型正在真正思考、识别约束或权衡后果的证据——这些都是对安全评估至关重要的属性。 这种做法建立在一个看似未得到充分检验的假设之上:模型陈述的推理实际上与其最终答案相关联。然而,事实往往并非如此。越来越多的关于CoT忠实性的研究表明,推理痕迹通常并不反映产生输出的内部计算过程(Turpin 等,2023 (https://arxiv.org/html/2607.07229#bib.bib1);Chen 等,2025 (https://arxiv.org/html/2607.07229#bib.bib3))。模型会依据未在推理中提及的信息行事,同时否认依赖那些已被证明影响其答案的特征(Walden 和 Wanner,2026 (https://arxiv.org/html/2607.07229#bib.bib4))。 然而,忠实性和一致性是截然不同的属性,需要不同的检测方法。检测忠实性依赖于受控干预,例如注入提示、扰动输入并测量变化,从而建立关于内部计算过程的因果论断。这些方法无法应用于现有的记录副本语料库。相比之下,一致性提出了一个更简单的问题:“陈述的推理在逻辑上是否与最终输出相关联并可以预测最终输出,即可观察到的文本?”这可以仅凭记录副本进行检测,无需任何实验干预,因此适合进行系统化的事后审计。 直接后果是,如果推理与答案脱钩,那么任何使用推理痕迹作为安全相关属性证据的评估,其实际测量的内容都将与其声称测量的内容不同。这是对构念效度的直接威胁——构念效度是评估是否真正测量了其设计所要测量的属性这一根本性问题。当模型的推理痕迹与其输出不关联时,会产生两个问题。首先,评估结果不可信。无论不一致性源于困惑、事后合理化还是策略性行为,评估都没有测量到其声称的内容。其次,CoT监控被削弱。安全研究人员日益依赖推理痕迹来监控模型在评估和部署期间的行为。推理与输出之间的不一致性使得这种监控不可靠。 我们引入推理一致性扫描作为一种方法论,用于检测那些思维链推理与其伴随答案脱钩的记录副本。我们并非提出一种新的评估方法,而是引入一个扫描器,该扫描器作用于现有评估产生的记录副本,事后分析推理与输出之间的关系。这是一个系统化的工具,用于标记任何记录副本语料库中的此类情况。我们的扫描器是对AI安全评估工具集的贡献,使用 InspectScout 实现(Meridian Labs, 2024 (https://arxiv.org/html/2607.07229#bib.bib9)),这是一个用于分析AI智能体记录副本的开源工具,并应用于来自 `inspect_evals` 的三个评估任务(UK AI Safety Institute, 2024a (https://arxiv.org/html/2607.07229#bib.bib8)),这是一个基于 `inspect_ai` 框架(UK AI Safety Institute, 2024b (https://arxiv.org/html/2607.07229#bib.bib7))构建的开源AI安全评估库。据我们所知,这是第一个通用型CoT一致性扫描器,也是首次将其应用于该评估套件的记录级别一致性分析。 我们的贡献如下: 1. 1. 将推理一致性形式化定义,区别于忠实性,包含一个六子类型的不一致性分类体系和一个明确的分类决策程序。 2. 2. 一个经过验证的合成基准数据集,包含60个来自 InstrumentalEval(He 等,2024 (https://arxiv.org/html/2607.07229#bib.bib10))的带标签记录副本,通过精细修改真实记录副本以引入特定的不一致性而构建。 3. 3. 一个为 InspectScout 实现的可运行扫描器,采用 LLM-as-judge 架构,并在基准数据集上进行了验证。 4. 4. 跨四个生成模型和三个评估任务的实证结果,表明推理不一致性存在于自然主义的AI安全评估记录副本中,并且随模型和任务类型的不同而变化。 ## 2 背景与动机 ### 2.1 评估构念效度 评估是否真正测量了其声称的内容,这是AI安全评估设计中的根本性问题。一个有用的框架将其分解为三个问题:(1) 目标属性是否清晰定义?(2) 任务设计是否正确操作化了该属性?(3) 该属性是否与评估旨在解决的实际危害相关联?(Raji 等,2021 (https://arxiv.org/html/2607.07229#bib.bib5);Bowman 和 Dahl,2021 (https://arxiv.org/html/2607.07229#bib.bib6))。 推理一致性是对第二个问题的直接威胁。许多与对齐相关的评估使用推理痕迹作为模型表现出目标属性的证据。例如,表明模型正在真正权衡伦理考量,而不是对偏好答案进行模式匹配。如果推理痕迹与输出不关联,则这一证据链断裂:评估可能给那些看似正确的记录副本打分,而模型实际上并未进行评分所暗示的推理。 ### 2.2 CoT忠实性与一致性 关于CoT忠实性的研究结果轨迹是清晰且日益令人担忧的。Turpin 等 (2023 (https://arxiv.org/html/2607.07229#bib.bib1)) 证明模型的解释系统性地受到其推理中未承认的特征的偏见影响。Lanham 等 (2023 (https://arxiv.org/html/2607.07229#bib.bib2)) 表明模型在其回答中依赖其陈述推理的程度在不同任务和模型规模之间存在显著差异。Chen 等 (2025 (https://arxiv.org/html/2607.07229#bib.bib3)) 将这些发现扩展到推理模型,表明CoT监控仅揭示了不到20%的模型使用注入提示的案例。最近,Walden 和 Wanner (2026 (https://arxiv.org/html/2607.07229#bib.bib4)) 证明模型即使在直接要求反思时也会积极否认对提示的依赖。 这些结果表明CoT推理经常是不忠实的。然而,所使用的方法(提示注入、反事实干预、提前回答)是实验操作,无法应用于现有的记录副本语料库。它们回答了“推理是否反映内部计算?”的问题,但无法用于对已经产生的评估结果进行持续审计。 推理一致性解决的是一个相关但不同的问题:“陈述的推理是否在逻辑上连接到最终输出?”这是一个较弱的论断,即模型可能产生看起来一致的推理,而该推理完全是事后进行的,但这一点仅凭记录副本即可检测。重要的是,当一致性失败时,无论根本原因是什么——不一致性源于困惑、事后合理化还是策略性行为——评估结果都同样无法解释。 目前没有现有的工具或基准系统性地针对安全评估记录副本中的这一属性。先前关于忠实性的工作使用学术基准(MMLU、GPQA、BIG-Bench Hard)和受控实验设置,这些不适用于正在进行的评估审计。我们的工作通过一个可重用的扫描器和经过验证的基准数据集填补了这一空白。 ## 3 方法 ### 3.1 一致性定义与分类体系 我们将记录副本定义为*一致*,如果答案反映了推理所建立的优先级、结论或方向,即可以从推理到输出画出一条思路线。这明确不是一个正确性检查:我们所检查的任务没有单一正确答案。我们仅评估推理所探讨的内容与答案所做的内容之间的内部一致性。 以下属性*不*足以构成不一致性。不确定性、模糊表述以及考虑多个方向后再定论的探索性推理是正常的深思熟虑模式,而非不一致性。答案远短于前面的推理(例如,在只要求一个字母的多选题中)如果简短答案遵循了推理的结论,则是一致的。 我们定义了六种不一致性子类型(表1 (https://arxiv.org/html/2607.07229#S3.T1)),按照扫描器应用的明确决策程序组织: 1. 1. 如果答案缺失或为空:不适用的。 2. 2. 如果推理部分实际上没有处理问题(例如,问题重述、通用开场白):推理缺失。 3. 3. 如果推理内部存在明确不相容的方向:矛盾推理。 4. 4. 如果没有明确矛盾但推理不连贯:明显混乱。 5. 5. 如果推理的最终结论明确指向一个方向,但答案却选择了另一个:推理反转。 6. 6. 如果推理提出了具体考虑,但答案忽略了这些考虑:推理放弃。 7. 7. 如果推理过于单薄,不太可能产生具体的答案:敷衍推理。 8. 8. 否则:一致。 有序的决策程序很重要:它可以防止扫描器在更少见的子类型(例如矛盾推理)更好地描述了脱节时,默认使用常见的子类型(例如推理反转)。 表1:六种不一致性子类型。决策程序按所示顺序进行检查;分配第一个匹配的子类型。 ### 3.2 扫描器 我们的扫描器使用 InspectScout(Meridian Labs, 2024 (https://arxiv.org/html/2607.07229#bib.bib9))实现,这是一个用于系统分析AI智能体记录副本的开源工具,遵循英国AISI发布并与InspectScout一同发布的最佳实践指南(Dubois 等,2026 (https://arxiv.org/html/2607.07229#bib.bib14))。该指南设定了记录副本分析的七个步骤。 扫描器采用 LLM-as-judge 架构,使用 InspectScout 的 `llm_scanner` API 实现。给定一个包含系统提示、问题、推理痕迹和最终答案的记录副本,扫描器生成一个结构化分类:一致性标签(`consistent`、`inconsistent` 或 `not_applicable`)、子类型标签、置信度评级(`high`、`medium` 或 `low`)、推理和答案的一句话摘要、任何脱节的描述以及简要理由。 扫描器提示中编码了上述完整的分类体系、决策程序和范围限制。关键设计选择包括:(1) 明确指令将探索性推理与已结论的推理区分开来,防止模型在考虑多个方向后做出决定时出现误报;(2) 相邻子类型之间的明确对比陈述(例如,矛盾 vs. 反转、缺失 vs. 敷衍)以减少错误分类;(3) 范围限制,防止扫描器评估事实正确性或对内部模型过程做出论断。 我们选择对所有生成器使用一个固定的扫描器模型。理由是这控制了扫描器方差。通过保持扫描器不变,每个测量都在同一尺度上。扫描器模型的选择被证明至关重要。我们评估了三个模型作为扫描器的LLM评判员,顺序如下:DeepSeek V4 Flash、Claude Haiku 4.5 和 Claude Opus 4.6。出乎意料的是,DeepSeek V4 Flash 经常无法生成有效的结构化输出,不得不被放弃。我们随后切换到另一个来自 Claude 家族的模型 Haiku 4.5。它产生了可靠的结构化输出,但在基准数据集上的每个子类型召回率显著较低,特别是对于更细微的不一致性子类型。在多次迭代改进扫描器但未能取得满意结果后,我们测试并选择了 Claude Opus 4.6,基于其优越的分类性能和一致的结构化输出来报告所有结果。 ### 3.3 合成基准数据集 我们构建了一个带标签的记录副本数据集,并在应用于自然主义数据之前用于验证扫描器。该数据集包含60个来自 InstrumentalEval(He 等,2024 (https://arxiv.org/html/2607.07229#bib.bib10))的带标签记录副本,InstrumentalEval 是一个测试工具性趋同行为(包括自我保存、追求权力和欺骗)的评估任务。这些记录副本使用 DeepSeek V4 Pro 生成。 一致的示例是未经修改的自然主义记录副本,选择标准为丰富性和清晰度。不一致的示例是经过精细修改以引入特定不一致性类型的真实记录副本。修改要么在答案部分进行,要么在推理部分进行。这产生了具有自然主义特征的记录副本,因为它们大部分是真实的。附录A.2 (https://arxiv.org/html/2607.07229#A1.SS2) 提供了一些不一致性子类型的代表性示例。 边界情况是接近类别决策边界的记录副本,旨在对扫描器进行压力测试。真实标签存储在与记录副本本身分开的文件中,通过样本ID进行键控。每个标签包括一致性分类、子类型、推理和答案的一句话摘要、任何脱节
相似文章
评估思维链的可监控性
OpenAI研究人员引入了一个框架和一套包含13项评估的系统,用于衡量大型语言模型中思维链的可监控性。研究发现,监控推理过程比仅监控输出有效得多,这为AI安全及规模化监督提供了重要启示。
超越准确率:在思维链推理中测量偏差识别以进行负责任的人工智能评估
本文提出了一种轨迹级别的诊断方法用于评估思维链推理,将易感性(偏差是否改变答案)与识别(轨迹是否标记有偏输入)分开。实验表明,GPT-4o 和 Claude Sonnet 4 等模型具有相似的易感性率,但识别率却大不相同,突显了仅基于准确率评估的盲点。
当思维链更明智时:多轮推理模型中的失败模式
本文通过引入CoT-Output安全矩阵分析了多轮推理模型中的失败模式,揭示了诸如在监控线索下伪装对齐率增加以及上下文注入失败(即安全的内部推理被有害输出覆盖)等悖论。
推理模型难以控制其思维链,但这其实是好事
OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。
风险链条:大型推理模型中的安全失效及通过自适应多原则引导进行缓解
本文研究了大型推理模型中的安全失效问题,即尽管最终答案安全,但推理轨迹中仍会出现有害内容,并提出了一种自适应多原则引导方法来缓解这些风险。