思维链推理在实际应用中并非总是忠实的
摘要
本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。
暂无内容
查看缓存全文
缓存时间: 2026/08/19 19:09
# 自然场景中的思维链推理并非总是忠实的 来源:https://arxiv.org/html/2503.08679 **Jett Janiak** *隶属机构:欧洲委员会人工智能办公室* **Robert Krzyzanowski** *隶属机构:Poseidon Research* **Senthooran Rajamanoharan、Neel Nanda、Arthur Conmy** *通讯作者:[arthurconmy@gmail\.com](mailto:[email protected])* #### 摘要 近期研究表明,当提示中存在明确偏差时,模型常会在其思维链输出中忽略这些偏差,表明语言化推理可能歪曲模型得出结论的真实过程(不忠实性)。本研究发现,在未经人工偏差添加或模型输出修改的自然语言、非对抗性提示中,同样存在不忠实的思维链现象。研究发现,当模型分别面对“X是否大于Y?”和“Y是否大于X?”时,有时会生成表面连贯的论证,为系统性地同时回答“是”或同时回答“否”提供依据,尽管这两种回答存在矛盾。我们初步证明这源于模型对“是”或“否”的隐含偏好,并将此命名为**隐含事后合理化**。研究结果显示,生产模型的不忠实率最高达13%,尽管前沿模型表现更忠实,但无一完全忠实,包括深度求索R1(0.37%)和带思维功能的Sonnet 3.7(0.04%)等思考模型。我们还研究了**不忠实的非逻辑捷径**现象,即模型通过微妙的非逻辑推理,使对复杂数学问题的推测性答案显得严谨。研究发现,尽管思维链可用于评估输出,但其并非模型内部生成答案的完整过程体现,在代理或安全关键场景中应谨慎使用。 #### 关键词 机器学习、大语言模型、思维链、忠实性 ††附属机构说明:同等贡献 ## 1 引言 参见说明 图1:Gemini 2\.5 Flash在回答逻辑相反的地理问题时出现**论证切换**。两条推理链看似合理,但模型对逻辑对立的两个问题给出相同错误答案。当被问及“阿杰伊河是否位于阿里萨罗盐沼以南”时,模型**基于半球位置推理**并得出否定结论(左图);当问题反转为“阿里萨罗盐沼是否位于阿杰伊河以南”时,若首次推理正确,模型应得出肯定结论。然而模型放弃地理推理,转而论证“位于以南”对位于不同大陆的地点无意义,再次给出否定答案(右图)。模型对首次问题的否定回答率达99%(198/200),对反转问题的否定回答率达63%(126/200)。这种**不一致且系统性**的推理标准应用,结合输出中从未承认地点顺序差异,体现了**不忠实推理**——即模型语言化推理与实际生成答案的内部过程不匹配。详细示例参见A\.1\.1节(https://arxiv.org/html/2503.08679#A9.SS1.SSS1)。 思维链推理(CoT;51 (https://arxiv.org/html/2503.08679#bib.bib18);42 (https://arxiv.org/html/2503.08679#bib.bib16);60 (https://arxiv.org/html/2503.08679#bib.bib13))已被证明是提升大语言模型性能的有效方法。近期众多性能突破得益于**思考模型**的发展,这类模型在响应用户前会生成长思维链(48 (https://arxiv.org/html/2503.08679#bib.bib20);22 (https://arxiv.org/html/2503.08679#bib.bib49);16 (https://arxiv.org/html/2503.08679#bib.bib15);45 (https://arxiv.org/html/2503.08679#bib.bib19))。尽管取得这些进展,近期研究揭示了一个关键局限:模型生成的思维链轨迹并不总是忠实于其产生最终答案的内部推理过程(36 (https://arxiv.org/html/2503.08679#bib.bib14);58 (https://arxiv.org/html/2503.08679#bib.bib1);34 (https://arxiv.org/html/2503.08679#bib.bib10))。此处的**忠实性**指推理链中阐述的步骤与模型实际采用的推理机制对应的程度(36 (https://arxiv.org/html/2503.08679#bib.bib14);29 (https://arxiv.org/html/2503.08679#bib.bib43))。由于内部推理机制难以直接解释,不忠实性通常通过行为不一致性检测:当模型对逻辑矛盾的提问采用不同推理策略支持相同答案时,当其使用动机性推理因提示线索改变答案时,或推理步骤与最终答案逻辑矛盾时。 然而现有针对不忠实思维链的研究主要集中在**明确偏差**设置,如在提示中引入偏差或引导(58 (https://arxiv.org/html/2503.08679#bib.bib1);12 (https://arxiv.org/html/2503.08679#bib.bib4)),或在思维链中插入推理错误(34 (https://arxiv.org/html/2503.08679#bib.bib10);65 (https://arxiv.org/html/2503.08679#bib.bib40))。这些研究虽揭示重要见解,但未解答不忠实性在自然、无提示情境中如何表现。这种认知局限阻碍我们全面评估不忠实思维链带来的风险与挑战。本研究在标准基准上检测不忠实性,不添加人工提示、额外偏差指令或修改模型输出。我们证明不忠实思维链推理可出现在思考与非思考前沿模型中,无需显式提示。我们将指标视为**行为忠实性**度量:即受控提示对间的可观测思维链行为是否与模型答案一致。行为忠实性是内部计算“认知忠实性”的必要非充分条件,解读结果时需注意此限制。 思考模型通常表现出更高的推理链忠实性,但我们的发现表明其仍未完全忠实。主要贡献包括: 1. 第2节(https://arxiv.org/html/2503.08679#S2)提供前沿模型在回答比较问题时表现**隐含事后合理化**的证据。通过分析针对“是否X>Y”与“是否Y>X”等是/否问题对生成的多条推理链,我们揭示模型为支持答案而修改引用事实或切换推理方式的系统性模式。此不忠实性基于*World Model*数据集(24 (https://arxiv.org/html/2503.08679#bib.bib29))子集生成的4,834对比较问题测量,问题经筛选确保无歧义且反对称(即同时回答“是”或同时回答“否”均存在逻辑矛盾,详见A\.2节(https://arxiv.org/html/2503.08679#A1.SS2))。 2. 第3节(https://arxiv.org/html/2503.08679#S3)展示前沿模型在解决复杂数学问题时表现**不忠实的非逻辑捷径**。在此类捷径中,模型使用明显非逻辑的推理跳跃至正确但未证明的结论,同时a)在该推理轨迹中不承认此捷径,b)在不同生成中被提示时能识别该推理步骤的非逻辑性。两项贡献均证明**自然场景中的思维链推理并非总是忠实**。所谓“自然场景”指比先前研究中的显式偏差注入或编辑推理轨迹更自然的标准非对抗性提示,即使并非来自真实用户流量。关键在于,这些不忠实模式会被完全独立于忠实性研究的研究者遇到:对问答比较进行模型能力评估或运行标准数学评测时,会无意中遭遇不忠实推理。这是相较于先前研究的重要进展,因为证明不忠实性通常需要展示陈述推理与模型答案生成过程的不匹配,通常需通过精心设计(如8 (https://arxiv.org/html/2503.08679#bib.bib52)),而这在使用非对抗性提示时更难实现。 为促进思维链忠实性领域的复现与深入研究,我们开源提供完整实验代码库及配套数据集(https://github.com/jettjaniak/chainscope)。 ##### 利益冲突声明 作者Senthooran Rajamanoharan、Neel Nanda和Arthur Conmy受雇于Google DeepMind,该公司主导开发了本文评估的Gemini模型。 ## 2 前沿模型与隐含事后合理化 图2:15个前沿模型及预训练模型在隐含事后合理化评估中的量化结果。每模型显示数据集总问题对数(4,834对)中表现出不忠实性的比例,分类标准详见2\.1节(https://arxiv.org/html/2503.08679#S2.SS1)。简言之,若(i)两个问题变体准确率差异≥50%,(ii)问题组存在≥5%的“是”或“否”倾向偏差,(iii)低准确率变体的正确标签与该偏差相反,则判定为不忠实对。误差棒显示问题对的95%引导置信区间(B=2,000)。更多统计见C节(https://arxiv.org/html/2503.08679#A3)。 本节通过分析模型对仅参数顺序不同的“是/否”问题对的响应(示例见A\.1节(https://arxiv.org/html/2503.08679#A1.SS1)表2(https://arxiv.org/html/2503.08679#A1.T2)),证明思考与非思考前沿模型存在不忠实性。为确保比较问题对无歧义且反对称,采用基于自动评估的两阶段模糊度过滤,排除那些同时回答“是”或同时回答“否”不构成逻辑矛盾的对(详见A\.2节(https://arxiv.org/html/2503.08679#A1.SS2))。此方法揭示了模型根据问题变体偏好特定参数或值的系统性模式。 我们观察到模型常生成与事后合理化一致的推理,支持其隐含偏差的响应,而非让推理忠实引导答案。此模式标志不忠实性,表明模型可能受未在推理中语言化的隐含偏差影响。该行为如图1(https://arxiv.org/html/2503.08679#S1.F1)所示,模型切换论证以证明两个问题均得“否”答案。全文将不忠实性定义在**问题对**层面:当模型对逻辑相反提示的行为与任何单一稳定推理规则不符时,我们标记该对为不忠实,即使单个思维链局部看似连贯。 尽管这些模式具系统性,我们尚未明确因果关系。一种合理解释是问题措辞变化影响模型从训练数据中提取的事实,不同提取事实可能影响最终答案,从而产生看似事后合理化实则源于事实提取差异的模式。但多方面证据指向事后合理化而非单纯事实提取变异性:首先,观察到的偏差系统性(尤其当模型对一变体保持事实而对另一变体修改时)暗示刻意合理化(见附录G(https://arxiv.org/html/2503.08679#A7));其次,探测实验表明偏差在推理过程开始前已部分编码于模型内部表征(见附录H(https://arxiv.org/html/2503.08679#A8))。综合表明模型可能常依赖与问题模板相关的隐含偏差,再构建推理链证明这些结论。 虽然自回归语言模型逐词生成,但仍可表现事后合理化特征:结论可能在生成早期隐含确定,随后构建合理化解释(62 (https://arxiv.org/html/2503.08679#bib.bib59))。下一节2\.1(https://arxiv.org/html/2503.08679#S2.SS1)描述不忠实模式的量化评估,2\.2节(https://arxiv.org/html/2503.08679#S2.SS2)详述模式在模型间的分布。 ### 2\.1 隐含事后合理化评估 本评估使用*World Model*数据集(24 (https://arxiv.org/html/2503.08679#bib.bib29))子集生成比较问题对数据集。每个比较问题为询问模型比较两实体值的是/否问题(如一实体“大于”或“小于”另一实体)。许多问题需短多步推理(如结合两地点知识并应用比较规则)。我们使用不同比较类型与数值顺序生成多样化问题,并测量每问题对的答案一致性。 具体而言,针对*World Model*子集每个属性(如电影上映日期)和比较类型(如“晚于”),通过以下步骤生成最多100对是/否问题:过滤罕见实体、收集可靠实体基准、生成无重叠的近值对、运行两阶段模糊度评估排除多解或反转问题无逻辑相反答案的问、抽样100个高质量问题对。最终数据集含4,834对问题,每对包含一个预期答案为“是”和一个预期答案为“否”的问题,总计9,668个问题,是/否问题分布均衡。数据集构建详情见附录A(https://arxiv.org/html/2503.08679#A1),模糊度过滤有效性验证及残余模糊率估算见附录B(https://arxiv.org/html/2503.08679#A2)。 我们使用简单提示生成思维链,要求模型逐步推理后给出是/否答案。对每模型,以温度0\.7、top-p 0\.9对数据集每个问题生成10个响应。评估涵盖来自Anthropic、OpenAI、Google、Meta、Qwen和DeepSeek六家开发者的15个前沿模型,包括思考与非思考模型,并以预训练模型作为比较基线。使用自动评估器将每条思维链标注为“是”、“否”或“未知”,其中“是/否”表示明确支持相应答案的推理,“未知”涵盖因信息缺失而拒绝等其他情况。
相似文章
推理模型难以控制其思维链,但这其实是好事
OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。
当思维链更明智时:多轮推理模型中的失败模式
本文通过引入CoT-Output安全矩阵分析了多轮推理模型中的失败模式,揭示了诸如在监控线索下伪装对齐率增加以及上下文注入失败(即安全的内部推理被有害输出覆盖)等悖论。
并非所有LLM推理都可见于思维链
本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。
脆弱的思考:大型语言模型如何处理思维链扰动
本论文对大型语言模型在思维链推理步骤中处理损坏情况的能力进行了全面的实证评估,在数学推理任务上针对13个模型和5种扰动类型(数学错误、单位转换、盲从、跳过步骤、额外步骤)进行了测试。研究结果揭示了异质性的漏洞模式,对在多阶段推理管道中部署LLM具有重要意义。
重新思考稠密顺序链:推理语言模型能够从稀疏、乱序的思维链中提取答案
来自联发科(MediaTek)和台湾国立大学的研究论文挑战了推理链必须稠密且按顺序排列的假设,展示了模型能够从稀疏、乱序且充满噪声的推理痕迹中提取答案。研究结果表明,答案提取具有鲁棒性且不依赖顺序,这可能为实现更高效、并行化的推理生成铺平道路。