CASE: 因果对齐与结构强化以提升思维链忠实性

arXiv cs.CL 论文

摘要

提出了CASE,一个结合训练时因果对齐与推理时结构强化的框架,旨在提升大语言模型思维链推理的忠实性,在多个基准测试中平均实现了37%的思维链忠实性提升。

arXiv:2607.18820v1 公告类型:新 摘要:思维链(Chain-of-thought, CoT)推理被广泛用于提升大语言模型(LLM)的性能和可解释性,但生成的推理过程可能无法忠实地支持最终答案。我们从一个因果视角研究该问题,其中忠实的CoT过程应遵循链Z→X→Y,Z、X、Y分别表示指令、推理链和最终答案。在此过程中,指令应仅通过推理链影响答案。然而,传统的自回归LLM在生成答案时同时基于指令和CoT,这仍然允许直接的指令到答案的捷径。为解决此问题,我们提出了CASE框架,该框架结合了训练时的因果对齐与推理时的结构强化。训练时,CASE构建反事实CoT、偏置指令和空指令数据集,并应用选择性损失微调来增强CoT到答案的依赖关系,同时抑制指令捷径。推理时,CASE掩码从指令标记到答案标记的直接注意力,防止模型绕过生成的CoT。我们提供了信息论分析,展示了这些组件如何促进忠实的链。在三个模型和四个基准测试上的实验表明,CASE在整体CoT忠实性上相比最强基线平均实现了37%的每设置相对改进,表现出更强的跨数据集忠实性迁移,并保持了具有竞争力的平均准确率。代码可在 https://github.com/oddwang/CASE 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 因果对齐与结构强制方法提升思维链忠实性 来源: https://arxiv.org/html/2607.18820 ###### 摘要 思维链(CoT)推理被广泛用于提升大型语言模型(LLM)的性能和可解释性,但生成的推理过程可能无法忠实支持最终答案。我们从因果角度研究这一问题,认为忠实的CoT过程应符合链式结构Z→X→Y,其中Z、X、Y分别表示指令、推理链和最终答案。在此过程中,指令应仅通过推理链影响答案。然而,传统的自回归LLM在生成答案时同时取决于指令和CoT,这仍允许存在直接的指令到答案的捷径。为解决这一问题,我们提出CASE框架,该框架结合了训练时的因果对齐与推理时的结构强制。训练时,CASE构建反事实CoT、偏差指令和空指令数据集,并应用选择性损失微调来增强CoT到答案的依赖关系,同时抑制指令捷径。推理时,CASE遮蔽从指令令牌到答案令牌的直接注意力,防止模型绕过生成的CoT。我们提供信息论分析,展示这些组件如何促进忠实的链。在三个模型和四个基准上的实验表明,CASE在整体CoT忠实性上相比最强基线实现了平均37%的设置内相对改进,展现出更强的跨数据集忠实性迁移能力,并保持了具有竞争力的平均准确率。代码可在 https://github.com/oddwang/CASE 获取。 ## 引言 思维链(CoT)提示在最终答案之前生成中间推理步骤,这不仅提升了大型语言模型(LLM)的性能,还为其决策提供了自然的解释(Wei et al. 2022 (https://arxiv.org/html/2607.18820#bib.bib1))。通过用自然语言表达推理步骤,CoT揭示了模型如何从输入推导出答案。然而,尽管其经验性能强劲,CoT作为解释的忠实性仍存在争议(Turpin et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib2); Lanham et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib4))。模型可能生成一条看似合理的推理链,但其答案是由绕过生成推理过程的捷径驱动的。为理解这一问题,Bao等人(2025 (https://arxiv.org/html/2607.18820#bib.bib29))使用三个变量对CoT推理建模:问题指令Z、推理链X和最终答案Y。通过基于干预的因果分析(Hagmayer et al. 2007 (https://arxiv.org/html/2607.18820#bib.bib30)),他们将忠实推理刻画为因果链Z→X→Y,其中指令仅通过CoT影响答案。相反,非忠实推理可能涉及直接的指令到答案捷径Z→Y,或答案对推理链的弱依赖X→Y(Bao et al. 2025 (https://arxiv.org/html/2607.18820#bib.bib29))。这种因果视角表明,提升CoT忠实性需要两个互补的目标:加强X→Y并抑制直接的捷径Z→Y。 参见图注 图1: CASE的高级直觉。CASE通过加强推理到答案路径X→Y并削弱直接的指令到答案捷径Z→Y来提升CoT忠实性。训练时对齐和推理时强制共同指导决策过程朝向忠实的因果链Z→X→Y。 最近的一些研究探索事后候选选择,即生成多个CoT并根据预定义的忠实性标准选择其中一个(Wang et al. 2025 (https://arxiv.org/html/2607.18820#bib.bib9); Jie et al. 2024 (https://arxiv.org/html/2607.18820#bib.bib8); Li et al. 2025a (https://arxiv.org/html/2607.18820#bib.bib10),b (https://arxiv.org/html/2607.18820#bib.bib12))。虽然这些方法可能高效,但它们在输出层面上运作,并未改变模型的答案生成机制。为了直接修改这一机制,一种更原则性的策略是对LLM本身进行微调,使用忠实的CoT监督(Tanneru et al. 2024 (https://arxiv.org/html/2607.18820#bib.bib27))、条件提取(Lin et al. 2025 (https://arxiv.org/html/2607.18820#bib.bib28))或双模型架构(Paul et al. 2024 (https://arxiv.org/html/2607.18820#bib.bib31))。尽管这些方法可以提升推理质量,但它们并未显式地强制执行最终答案源自CoT而非直接来自指令的忠实机制。因此,模型在答案生成时可能仍然依赖Z→Y捷径。 受因果视角的启发,我们提出CASE(因果对齐与结构强制),一个提升CoT忠实性的框架。在训练时,CASE构建反事实CoT、偏差指令和空指令数据集,并应用选择性损失微调来加强X→Y,同时减少对Z→Y捷径的依赖。在推理时,CASE应用注意力掩码干预,阻止答案令牌直接关注指令令牌,从而移除显式的指令到答案注意力路径,同时保留中介的CoT侧路径。我们进一步提供信息论分析,表明训练损失促进了三个互补标准:增加I(X;Y)、增加I(X;Y|Z)和减少I(Y;Z|X)。与推理时掩码一起,这些组件指导决策过程朝向忠实的因果链Z→X→Y,如图1所示(https://arxiv.org/html/2607.18820#Sx1.F1)。本文的主要贡献如下: - ∙我们提出CASE,一个通过训练时因果对齐和推理时结构强制提升CoT忠实性的框架。 - ∙我们提供理论分析,将CASE的训练目标与互补的信息论忠实性标准联系起来,并展示推理时掩码如何移除显式的指令到答案注意力路径。 - ∙在四个基准数据集上使用两个非推理型LLM和一个推理型LLM进行的实验表明,CASE显著提升了CoT忠实性,相比最强基线实现了超过37%的平均改进,同时保持了具有竞争力的准确率和强大的跨数据集泛化能力。 ## 相关工作 本节回顾以往关于评估和提升CoT忠实性的研究。 ### CoT忠实性的评估 现有研究主要通过扰动输入指令(Atanasova et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib3); Turpin et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib2))、生成的CoT(Lanham et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib4))或模型本身(Tutek et al. 2025 (https://arxiv.org/html/2607.18820#bib.bib5)),然后测量最终答案是否发生变化来评估CoT忠实性。在这些方法中,Filler Tokens将CoT替换为"..."令牌,并评估答案是否变化(Lanham et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib4); Zaman and Srivastava 2025 (https://arxiv.org/html/2607.18820#bib.bib32))。Early Answering逐句截断CoT,并计算在不同截断点保持相同答案的概率的曲线下面积(AOC),测试模型是否能在观察到完整推理链之前回答(Lanham et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib4))。Zaman和Srivastava (2025 (https://arxiv.org/html/2607.18820#bib.bib32))最近的一项系统研究表明,Filler Tokens和Early Answering是衡量CoT忠实性最可靠的指标。因此,我们采用它们作为主要的基于扰动的评估指标。我们进一步包含Paul等人(2024 (https://arxiv.org/html/2607.18820#bib.bib31))使用的受控间接效应(CIE)和受控直接效应(CDE)指标作为补充的因果评估。CIE用反事实CoT替换CoT,测试答案是否依赖于推理链。CDE在保持CoT固定的同时,用反事实问题替换原始问题。如果答案仍然改变,则表明存在直接的Z→Y捷径和较低的忠实性。CIE和CDE共同评估答案是否由CoT而非指令直接控制,为基于扰动的指标提供因果补充。 ### 提升CoT忠实性的方法 最近的研究提出了多种提升CoT忠实性的方法。一些方法进行事后候选选择,生成多个CoT并通过评分或过滤选择一个(Wang et al. 2025 (https://arxiv.org/html/2607.18820#bib.bib9); Jie et al. 2024 (https://arxiv.org/html/2607.18820#bib.bib8); Li et al. 2025a (https://arxiv.org/html/2607.18820#bib.bib10),b (https://arxiv.org/html/2607.18820#bib.bib12))。虽然这些方法可以改善选中的输出,但它们仅在生成后干预,并且不改变答案生成机制。更直接的策略是对LLM本身进行微调。Tanneru等人(2024 (https://arxiv.org/html/2607.18820#bib.bib27))使用忠实CoT微调LLM,但发现改进有限。Lin等人(2025 (https://arxiv.org/html/2607.18820#bib.bib28))提出FoCus,提取问题条件,引导模型在推理过程中使用它们,并在生成的结构化推理数据上微调模型。然而,这些方法主要改善推理质量,并未显式地将答案生成与忠实链Z→X→Y对齐。因此,指令仍可能为答案提供捷径。 参见图注 图2: 提出的CASE框架概览。 Paul等人(2024 (https://arxiv.org/html/2607.18820#bib.bib31))提出FRODO,一个用于提升CoT忠实性的双模型框架。FRODO使用直接偏好优化(DPO)(Rafailov et al. 2023 (https://arxiv.org/html/2607.18820#bib.bib33))和隐式因果奖励训练推理模块,并结合使用因果偏好目标训练的推理模块。这种设计鼓励最终答案更多地依赖生成的CoT。然而,由于答案生成模块仍可访问原始问题,FRODO并未严格移除直接的指令到答案路径。此外,由于FRODO将推理生成和答案预测分配给两个独立的模块,它主要改善管道级别的一致性,而不是让单个LLM学习从其自身的CoT到其答案的所需依赖关系。这种分离还增加了系统复杂性和计算成本。相比之下,CASE直接干预单个LLM的答案生成过程。它构建反事实CoT、偏差指令和空指令数据集并进行选择性损失微调,同时应用推理时注意力掩码来加强X→Y并抑制直接的Z→Y路径。因此,我们将CASE与基于微调的基线进行比较,这些基线与CASE一样,每个实例生成一个CoT。事后选择方法需要多次生成,在正交的输出选择层面上运作,并且可以与CASE或任何微调模型结合使用。 ## 方法论 本节首先定义CoT忠实性,然后介绍CASE,最后分析其组件如何支持忠实的答案生成。 ### 问题形式化 设Z、X和Y分别表示指令、推理链和最终答案的空间。我们用Z∈Z、X∈X和Y∈Y表示相应的随机变量,用z、x和y表示具体实例。给定一个指令z,参数为θ的自回归LLM首先生成CoT x,然后预测答案y。该过程可分解为: pθ(x,y|z) = pθ(x|z) pθ(y|z,x), 其中pθ(x|z)表示推理生成过程,pθ(y|z,x)表示在指令和CoT条件下的答案生成过程。 ###### 定义1 (CoT忠实性). 基于CoT的决策过程是忠实的,当且仅当指令仅通过生成的CoT影响最终答案。形式上,生成过程分解为: pθ(x,y|z) = pθ(x|z) pθ(y|x), 或者等价地,答案机制满足: pθ(y|z,x) = pθ(y|x)。 这意味着条件独立性条件。它对应于忠实的因果链Z→X→Y:指令引发推理链,最终答案源自推理链(Bao et al. 2025 (https://arxiv.org/html/2607.18820#bib.bib29))。重要的是,这并不意味着Z不影响Y。相反,Z对Y的任何影响都应由X中介。这里,X是可见的自然语言CoT,而答案生成可以访问在Z下形成的CoT侧状态H_X。保留在H_X中的指令信息仍然是CoT中介的;注意力掩码鼓励这一结构路径,而可见CoT扰动则评估文本X是否支持Y。 鼓励忠实性的一种理想方式是按照分解pθ(x|z) pθ(y|x)训练模型,使得答案生成仅依赖于CoT。然而,这在自然语言推理中很难实现:最终答案y是有监督的,而有效的CoT x不是唯一的。从头开始强制仅由x决定y可能会产生退化或低质量的CoT,例如直接揭示答案的痕迹。因此,实用的LLM通常采用更灵活的分解pθ(x|z) pθ(y|z,x),其中指令有助于生成和解释CoT,但也允许不忠实的捷径Z→Y。CASE从这种实际机制出发,将答案生成正则化到定义1中的CoT中介机制,同时保留Z→X并加强X→Y,同时抑制直接的捷径Z→Y。 ### CASE用于CoT忠实性 受上述形式化的启发,我们提出CASE,一个结合训练时因果对齐和推理时结构强制的框架。如图2所示(https://arxiv.org/html/2607.18820#Sx2.F2),CASE构建混合训练数据集并应用选择性损失监督微调(SFT)来加强CoT到答案的机制。然后,它在答案生成期间应用注意力掩码来阻挡直接的指令到答案路径。这两个阶段是互补的:训练时对齐学习了一个可靠的X→Y机制,但没有移除直接的指令到答案路径;而推理时掩码移除了该路径,但依赖于学到的X→Y机制来保持答案质量。 #### 训练时因果对齐 给定一个

相似文章

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

忠实性作为信息流:评估与训练忠实的思维链推理

arXiv cs.LG

本文提出一个框架,通过控制信息流来评估和提升思维链推理的忠实性,使用基于熵、KL散度和梯度的诊断方法,并引入训练干预措施(注意力掩码、梯度掩码、对抗扰动),使推理更加透明,减少对捷径的依赖。

CoRA: 面向可靠思维链推理的置信度-理由对齐

arXiv cs.CL

本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。

基于约束锚定的推理轨迹

arXiv cs.AI

提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。