CEDAR-GRPO: 过程感知强化学习用于大型语言模型中的通用溯因推理

arXiv cs.AI 论文

摘要

本文介绍了CEDAR-GRPO,一个过程感知的强化学习框架,通过结合最终答案正确性和溯因奖励来增强大型语言模型中的溯因推理能力,并展示了在多个未见任务上的可迁移改进。

arXiv:2608.14791v1 Announce Type: new 摘要:溯因推理,通常被描述为推断最佳解释,是不确定性下解释的核心,从日常的意义理解和调查到科学发现。然而,大型语言模型的研究大多通过狭窄、特定任务的基准来研究溯因推理,这使得观察到的增益是否能超越用于训练或评估的基准家族而迁移变得不明确。我们询问强化学习后训练是否能将溯因推理作为可迁移的推理能力来提升。我们引入了CEDAR-GRPO,一个过程感知框架,结合最终答案正确性和溯因奖励,用于证据覆盖和证据到解释的方向性。四个开放权重的大型语言模型在一个受控的、领域中性的溯因假设生成和假设选择任务混合物上进行后训练。我们在11个未见任务上评估它们,这些任务涵盖假设选择、缺失事实生成、可废止推理、长上下文调查、临床推理、代码调试和非溯因控制。CEDAR-GRPO在每个保留任务上提升了每个模型,相对于基础模型和仅正确性GRPO,平均增益分别为7.4和2.7分,最大增益为30.8分。消融研究证实强化学习、溯因奖励设计和任务多样性各自对迁移有贡献。过程级指标进一步显示了更强的溯因行为,包括探索替代方案、消除对手、回溯和不确定性标记。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:07

# CEDAR-GRPO:面向LLM中通用溯因推理的过程感知强化学习  
来源:https://arxiv.org/html/2608.14791  

Moein Salimi¹,Danial Parnian¹,Shaygan Adim¹,Amirmohammad Ebrahiminasab²,\*Nima Alighardashi¹,\*Parsa Gholami¹,\*Sahand Akramipour¹  
Mahdi Jafari Siavoshani¹,†,Mohammad Hossein Rohban¹,†  
¹ 谢里夫理工大学  
² 德黑兰大学  
\{mjafari,rohban\}@sharif.edu  

###### 摘要  
溯因推理,常被描述为“对最佳解释的推理”,是从日常理解、调查到科学发现等不确定性解释的核心。然而,大语言模型研究大多通过狭窄、特定任务的基准来研究溯因推理,尚不清楚观察到的增益是否能迁移到用于训练或评估的基准之外。我们探讨强化学习后训练能否提升溯因推理作为可迁移推理能力。本文提出CEDAR-GRPO,一种过程感知框架,结合最终答案正确性与基于证据覆盖和证据-解释方向性的溯因奖励。四个开源权重LLM在受控、领域中立的溯因假设生成与假设选择任务混合数据上进行后训练。我们在11个未见任务上评估,涵盖假设选择、缺失事实生成、可废止推理、长上下文调查、临床推理、代码调试和非溯因对照任务。CEDAR-GRPO在每个保留任务上均优于基础模型和仅正确性GRPO,平均增益分别为7.4和2.7点,最大增益达30.8点。消融实验确认强化学习、溯因奖励设计和任务多样性均对迁移性有贡献。过程级指标进一步显示溯因行为增强,包括探索备选项、排除竞争假设、回溯和不确定性标记。¹  

¹ 代码和数据可在https://github.com/cedar-grpo/cedar-grpo获取。  
¹¹脚注:同等贡献。  
²²脚注:同等通讯作者。  

## 1 引言  
临床医生解读复杂症状、工程师诊断间歇性故障、侦探从零散线索重构犯罪现场——他们面临相同的推理问题:必须从不完整证据推断隐藏解释。这一解释步骤即溯因推理,经典理解为从观察转向使其不那么令人意外的假设,常被描述为“对最佳解释的推理”(26;24)。对LLM而言,溯因能力至关重要,因为语言模型的许多实际应用——包括诊断、科学假设形成、证据解释、调试和长上下文调查——都依赖于识别最能解释不确定观察的潜在原因、缺失事实或底层机制。  

**ART 示例**  
- 观察1:Brad正凝视市中心喷泉。  
- 观察2:然后Brad走开了,愉快地吹着口哨。  
- 假设1:Brad对着流星许愿。  
- 假设2:Brad用硬币许愿。  
- 正确答案:假设2。  

**仅正确性GRPO**  
Brad在市中心看着喷泉的水。喷泉有平静的水面像镜子。由于市中心高楼挡住了天空视线,他在喷泉倒影中看到流星。他对那颗流星许愿,然后愉快地走开,因为他很高兴在城市里捕捉到如此罕见的景象。  
最终答案:假设1。  

**CEDAR-GRPO**  
让我们看看证据:Brad“凝视喷泉”然后“愉快地吹着口哨”走开。公共喷泉与投币许愿密切相关。如果考虑假设1,Brad需要抬头望天。但他特意凝视喷泉,因此假设2更符合观察。他很可能向水里扔了枚便士,许愿后愉快地离开。  
最终答案:假设2。  

**图1**:CEDAR-GRPO将其答案基于观察证据,而仅正确性GRPO依赖无依据的假设。  

近期工作引入了溯因推理的有价值的基准,包括用于常识假设选择的ART(2)、可解释因果推理的e-CARE(6)、鉴别诊断的DDXPlus(37)、缺失事实生成的ProofWriter和AbductionRules(35;40),以及基于知识图谱生成解释观察关系结构的假设的方法(1)。然而,进展通常在单一基准族、任务格式或结构化领域内评估,难以确定方法是提高了溯因作为可重用推理能力,还是仅使模型适应狭窄的表述形式。这一问题尤为重要,因为溯因任务主要有两种形式:假设生成(模型提出解释)和假设选择(在候选中选择)(29)。因此,令人信服的溯因改进证明应展示跨这两种形式以及超越训练特定格式的迁移性。  

我们研究强化学习后训练能否产生此类可迁移改进。本文提出**CEDAR-GRPO**(正确性、证据覆盖与方向性溯因奖励),一种过程感知的GRPO框架,结合确定性最终答案正确性——使用精确匹配、基于标签或基于执行的验证——与两个溯因奖励:观察证据的覆盖和从观察到解释的方向保持。这些奖励旨在鼓励解释在保持溯因推理定义结构的同时,涵盖可用证据。图1展示了该框架在ART上的行为,图2总结了训练和评估流程。  

**图2**:CEDAR-GRPO概览。该框架在溯因假设生成和选择任务上训练LLM,使用结构化输出和结合正确性、证据覆盖及证据-解释方向性的复合奖励,然后在保留数据集上评估任务准确性和推理行为。  

我们在受控、领域中立、知识轻量的混合数据上对四个开源骨干模型——Qwen3-4B、Qwen3-8B、DeepSeek-R1-Distill-Qwen-7B和Llama-3.1-8B-Instruct——进行后训练,该混合涵盖假设生成和假设选择。混合包括形式化和常识性假设选择、缺失事实生成和规则学习任务。这种设计使迁移更易解释:在这些训练格式之外的改进较不可能归因于狭窄领域适应。  

我们在11个未见任务上评估,涵盖假设选择、缺失事实生成、可废止推理、长上下文调查、临床推理、代码调试、前向因果推理和通用多步推理。该套件包含直接溯因目标、溯因邻接迁移任务和非溯因对照。我们还使用七个过程级指标分析推理轨迹——分支度、回溯、差异排除、先验调用、证据覆盖、证据-解释方向性和不确定性标记——以检验准确度提升是否伴随溯因行为变化。  

所有四个骨干模型上,CEDAR-GRPO在每个保留任务上均优于基础模型和仅正确性GRPO基线(Cor-GRPO)。平均而言,其相对基础模型提升7.4点,相对Cor-GRPO提升2.7点,其中DeepSeek-R1-Distill-Qwen-7B在MuSR-Murder上最大提升达30.8点。如预期,证据覆盖和方向性(训练中直接优化)显著提升。超越这些奖励指标,CEDAR-GRPO还改善了所有五个保留过程指标,显示更多备选项探索、竞争假设排除、回溯、先验调用和不确定性标记。  

消融实验表明强化学习、两个过程奖励组件以及生成与选择导向训练数据的结合均对迁移性有贡献。综合而言,这些结果表明溯因推理可作为可迁移能力被增强,而非仅通过基准特定优化实现。  

我们的主要贡献是:(1)用于研究跨任务溯因迁移的受控框架;(2)CEDAR-GRPO,它在基于正确性的RL基础上增加证据覆盖和证据-解释方向性奖励;(3)跨四个骨干和11个保留任务的系统迁移证据,辅以任务级评估、保留过程指标和针对性消融。  

## 2 相关工作  
### 2.1 溯因任务与基准  
自然语言处理中的溯因推理通常通过要求模型从不完整观察中推断合理解释、缺失事实或潜在原因的任务来研究。现有基准以多种形式体现这一能力,包括ART和UNcommonsense中的常识假设选择、e-CARE中的可解释因果推理、DDXPlus中的临床鉴别诊断、ProofWriter和AbductionRules中的溯因缺失事实生成,以及基于知识图谱的结构化假设生成(2;41;6;37;35;40;1)。这些资源对测量溯因行为至关重要,但常使改进难以与特定领域、输出格式或验证机制分离。因此,本工作将溯因视为更广泛的能力,其改进应跨假设生成和假设选择设置迁移,且超越用于训练的任务。  

### 2.2 溯因推理方法  
先前提高溯因推理的方法主要依赖监督适应或推理时脚手架。监督、基于排名和基于偏好的目标使用标记溯因数据训练模型,通过模仿参考解释或学习偏好更强假设(43;13)。相比之下,近期LLM管道使用提示、检索、多智能体分解或符号检查来分离观察解释、假设生成和假设评估(25;23;14;21;16)。最近,LogiDynamics(42)证明将溯因推理嵌入更广泛逻辑推理管道并结合迭代改进,能系统性提升性能。虽然对任务特定适应或推理控制有效,但这些方法未解决后训练能否内化广泛可泛化溯因行为的问题。  

### 2.3 RL后训练与过程感知奖励  
强化学习提供了针对任务级标准优化溯因推理的自然方式,但其在溯因中的应用仍狭窄。RLF-KG使用来自知识图谱的PPO式反馈生成解释观察事实的逻辑假设,CtrlHGen应用基于GRPO的强化微调,奖励语义对齐和条件满足,DARK将耦合GRPO变体应用于掩码扩散模型,以统一知识图谱上的演绎和溯因推理(1;8;7)。更广泛地说,GRPO作为PPO的内存高效替代被引入用于数学推理(31),近期RL后训练工作显示可验证奖励能引发验证、反思和策略适应等行为(10)。然而,这些成功集中于数学、代码或结构化推理。CEDAR-GRPO则研究广泛溯因迁移:它将可验证正确性与基于证据覆盖和证据-解释方向性的过程感知奖励相结合,灵感来自过程监督工作,但避免依赖人类标记的推理轨迹(22;38)。  

## 3 数据收集  
### 3.1 数据集选择  
我们构建训练池和评估套件以受控且异质的方式探测溯因推理。遵循近期综述采用的溯因两阶段观点,我们将溯因推理视为包含*阶段I*假设生成和*阶段II*假设选择(29)。这一区分在我们的设置中至关重要:模型可通过提出更好解释假设、更可靠评估候选假设或两者兼有来改进。为避免混淆这些可能性,我们未围绕单一基准族构建训练池。  

我们的数据收集策略是故意不对称的。训练池限于广泛非专业资源,涵盖溯因管道的两个阶段,因此增益不太可能反映狭窄领域适应或生成或选择的孤立进展。评估套件更广泛:除经典溯因基准外,还包括抽象逻辑数据、允许溯因解释的邻近任务和明确的非溯因对照。这种设计让我们提出更尖锐的问题:GRPO是学习可重用溯因行为,还是仅适应少数基准的表面形式?  

整个过程中,我们保持学习和测量之间的严格分离:评估数据集从未用于模型优化或模型选择。附加数据集特定说明见附录A。  

### 3.2 训练与验证数据  
训练池详见附录A(表5),由针对溯因阶段I和阶段II的数据集组成。阶段II组要求模型评估解释、原因或证据关系的合理性,或在竞争假设中选择。UniADILR-HGc和Balanced COPA提供紧凑的经典溯因选择信号。CauseLogics询问候选前提是否使推论合理,捕捉假设评估的核心部分:检查假设是否能逻辑且健全地解释观察。CLIMATE-FEVER提供阶段II邻接信号,要求模型(截断)

相似文章

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。

使用推理代理的大规模反例引导学习

arXiv cs.LG

本文提出将反例引导学习用于LLM执行正则表达式归纳,其中验证器提供反例以优化候选表达式。该方法显著提高了具有挑战性任务上的样本效率和成功率,表明LLM可以从结构化反馈中受益,而不仅仅是将其视为额外数据。