LC-ERD:通过一致性规约的奖励分解挖掘潜在逻辑实现自我进化推理

arXiv cs.AI 论文

摘要

LC-ERD是一个框架,从LLM生成的推理链中挖掘潜在逻辑,将全局奖励分解为步骤级信号,实现无需人工标注的自我进化推理。它通过变分逻辑势和多智能体值分解来解决标签噪声、粗粒度监督和分布崩溃问题。

arXiv:2605.24005v1 公告类型:新 摘要:大型语言模型(LLM)推理的发展受到高质量过程数据稀缺的瓶颈制约。虽然通过内源性奖励进行自我对齐提供了一种解决方案,但挖掘有效监督面临三个挑战:(1)通过模仿偏差产生的标签噪声,其中奖励优先考虑统计可能性而非逻辑真值,造成掩盖复合错误的“正确性幻觉”;(2)粗粒度监督,稀疏的全局结果(例如GRPO中的)无法提供细粒度指导,将推理链视为整体;(3)分布崩溃,信号无法在不放大预训练偏差的情况下泛化。为了解决这些问题,我们引入了LC-ERD(逻辑一致的内源性奖励分解),这是一个将自我对齐视为潜在结构挖掘的框架。我们通过聚合模型的潜在逻辑专家(LLE)的共识导出一个变分逻辑势,以对推理流形进行降噪,并引入基于IGM原理的多智能体值分解协议来量化单个步骤的效用。实验表明,LC-ERD提供了一条稳健的自我进化路径,揭示了逻辑一致性与准确性之间的权衡,同时识别出标准奖励遗漏的高价值推理模式。我们的代码可在 https://github.com/Reinhardmannn/LC-ERD 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:04

# LC-ERD:通过一致性约束的奖励分解挖掘潜在逻辑,实现自我进化推理
来源: https://arxiv.org/html/2605.24005
\(2026\)

###### 摘要。

大语言模型(LLM)推理的演进受到高质量过程数据稀缺的制约。尽管通过内源奖励进行自我对齐提供了一种解决方案,但挖掘有效监督面临三大挑战:(1) **通过模仿偏差产生的标签噪声**——奖励优先考虑统计可能性而非逻辑真实性,产生了掩盖复合错误的“正确性幻觉”;(2) **粗粒度监督**——稀疏的全局结果(例如GRPO中)无法提供细粒度指导,将推理链视为一个整体;(3) **分布坍塌**——信号若未放大预训练偏差则无法泛化。为解决这些问题,我们提出**LC-ERD**(逻辑一致的内源奖励分解)——一个将自我对齐重构为潜在结构挖掘的框架。我们通过聚合模型**潜在逻辑专家**(LLE)的共识来推导**变分逻辑势**,对推理流形进行去噪,并引入基于IGM原则的**多智能体价值分解**协议以量化单步效用。实验表明,LC-ERD提供了一条稳健的自我进化路径,揭示了逻辑一致性与准确性之间的权衡,并识别出标准奖励遗漏的高价值推理模式。我们的代码可在 https://github.com/Reinhardmannn/LC-ERD 获取。

自我进化推理,信用分配,内源奖励

††版权:ACM授权 ††期刊年份:2026 ††会议:第32届ACM SIGKDD知识发现与数据挖掘会议;2026年8月9–13日;韩国济州岛 ††CCS:计算方法学 强化学习

## 1. 引言

大语言模型(LLM)的快速发展显著扩展了其问题解决能力,使其能够在从形式数学到临床诊断等多个领域进行自主问题求解 (Wang et al., 2025b (https://arxiv.org/html/2605.24005#bib.bib37); Jiang et al., 2025 (https://arxiv.org/html/2605.24005#bib.bib18); Wang et al., 2026 (https://arxiv.org/html/2605.24005#bib.bib35))。这一进展的核心是自我对齐范式 (Sun et al., 2023 (https://arxiv.org/html/2605.24005#bib.bib31); Jiang et al., 2026 (https://arxiv.org/html/2605.24005#bib.bib17)),其中模型利用内源奖励信号——理论上等同于解决离线逆强化学习(IRL)目标 (Jarboui and Perchet, 2021 (https://arxiv.org/html/2605.24005#bib.bib15); Ng and Russell, 2000 (https://arxiv.org/html/2605.24005#bib.bib27))——来迭代优化其推理能力,而无需昂贵的人工循环标注。通过激发这些潜在价值函数 (Wu et al., 2025 (https://arxiv.org/html/2605.24005#bib.bib38)),LLM理论上可以实现闭环自我进化,在其自身输出分布中识别并强化高质量轨迹。

参考图注图 1. **奖励机制比较**。 (a) 基于结果的监督(例如GRPO)仅根据最终答案分配统一信用(\(+0.1\))。这产生了“正确性幻觉”:中间逻辑错误(红色节点)被无意中强化。 (b) LC-ERD(我们的方法)挖掘潜在逻辑以分解全局奖励。它检测潜在逻辑违规,对结构缺陷施加细粒度惩罚(例如 \(-0.11\)),从而区分有效推理与“幸运猜测”。

尽管这种自我监督的进化前景诱人 (Vinhas et al., 2024 (https://arxiv.org/html/2605.24005#bib.bib34)),但从模型自身生成中挖掘高保真监督仍然是一项重大挑战。当前最先进的内源方法,如组相对策略优化(GRPO)(Shao et al., 2024 (https://arxiv.org/html/2605.24005#bib.bib30)),依赖于粗粒度的结果监督。虽然对短视界有效,但这些整体信号存在**粒度不匹配**问题:它们对成功链中的所有步骤分配统一的正面信用,不加区分地强化了重要推论以及“幸运猜测”甚至逻辑幻觉。这种缺乏区分性造成了**正确性幻觉**(图 1 (https://arxiv.org/html/2605.24005#S1.F1)a),其中中间逻辑错误(可视化红色节点)由于标签噪声而被无意中挖掘为有效模式。为了摆脱这个**模仿陷阱**,我们认为自我进化必须从盲目的结果匹配转向**细粒度结构挖掘**。具体来说,我们必须分解全局奖励以检测并惩罚**潜在逻辑违规**(图 1 (https://arxiv.org/html/2605.24005#S1.F1)b),确保信用动态分配——对结构缺陷施加细粒度惩罚(负势能),同时隔离并强化真正的逻辑骨干。

为了解决这个挑战,我们不再追求单一的、基于模仿的奖励信号,而是优化**逻辑一致的内源奖励分解(LC-ERD)**——一个将推理轨迹建模为由连续逻辑势驱动的离散智能体决策序列的框架。我们引入 LC-ERD 将自我对齐过程重构为顺序“步骤智能体”间的合作博弈,受个体-全局-最大(IGM)原则支配。我们的框架从潜在专家流形中采样逻辑一致的奖励信号,提供适应每个推理步骤认知难度的高保真反馈。通过将全局终端奖励分解为密集的、一致性调节的内在势能,LC-ERD 有效解决了困扰传统内源对齐的信用分配瓶颈,同时绕过了静态、一刀切奖励函数的局限性。

LC-ERD 的核心在于两种协同机制:(1) **潜在逻辑专家(LLE)发现**,从多路径采样中提取“逻辑共识”作为内源锚点;(2) **变分逻辑势(VLP)**,一个连续的奖励塑形函数,通过量化当前策略与发现共识之间的差异来惩罚逻辑漂移。与依赖静态规则或昂贵外部评判器的现有手工或自动化系统不同,LC-ERD 根据模型内部不确定性调整其纠错强度。这允许模型的生成能力与其评估直觉之间进行更有纪律的协作,确保即使在缺乏外部监督的情况下,自我进化路径仍然锚定于逻辑真理。

在数学推理(MATH-500 (Mayilvahanan et al., 2025 (https://arxiv.org/html/2605.24005#bib.bib25)),GSM8K (Zhong et al., 2026 (https://arxiv.org/html/2605.24005#bib.bib49)))和专门医疗对话基准上的综合评估表明,LC-ERD:(I) 需要零人类偏好数据或外部LLM调用,(II) 在推理准确率上超过标准内源奖励基线 8.5%∼14.2%,并且 (III) 在长链轨迹中对逻辑幻觉具有优越的鲁棒性。我们的理论分析进一步证实,LC-ERD 将自我进化的次优性界 (Bozkurt et al., 2026 (https://arxiv.org/html/2605.24005#bib.bib2)) 压缩了因子 \((1-\delta)\),建立了可证明更稳定的收敛路径。本文的主要贡献如下:

- **推理抑制因素的正式解构**。我们将**模仿偏差**和**信用分配瓶颈**识别为自我进化推理的主要抑制因素,并提供了关于为什么整体内源奖励在长链任务中失败的正式解构。
- **逻辑一致的奖励分解框架**。我们引入**LC-ERD**,一个将全局推理效用分解为一致性驱动的个体奖励的自动化框架,实现了用于 token 级自我对齐的 IGM 原则。
- **自动逻辑锚点激发**。我们提出**潜在逻辑专家(LLE)**算法,一个无需训练的协议,用于从模型分布中激发逻辑锚点,有效绕过了手动规则设计的局限性。
- **广泛的实证与理论验证**。我们通过大量实验证明,LC-ERD 显著提升了 LLM 自我进化的性能和可靠性,在多种逻辑和医疗领域超越了最先进的基线。

## 2. 方法论

参考图注图 2. **LC-ERD 框架架构与训练范式**。 (a) **潜在逻辑专家(LLE)**通过条件采样激发,以构建跨多种基准(数学、医疗、法律)的**逻辑一致推理流形(LCRM)**。 (b) **LC-ERD 分解**模块将内部状态转化为双分量奖励 \(R=\tilde{r}+\gamma(\Phi_{h+1}-\Phi_h)\),其中 \(\tilde{r}\) 捕捉模仿模式,\(\Phi\) 代表变分逻辑势。 (c) **训练目标**结合了用于价值稳定性的时序差分损失 \(\mathcal{L}_{TD}\) 和 logit 对齐项 \(\mathcal{D}_{indiv}\),使模型能够通过最小化其推理路径与潜在逻辑真实值之间的差异来自我进化。

在本节中,我们介绍 **LC-ERD** 的技术框架。如图 2 (https://arxiv.org/html/2605.24005#S2.F2) 所示,我们的框架将自我对齐过程解耦为潜在专家发现、奖励分解和多智能体联合优化范式。标准内源奖励将自我对齐视为直接的模仿任务。相比之下,LC-ERD 将推理重构为多智能体协调 (Zhang et al., 2020 (https://arxiv.org/html/2605.24005#bib.bib46)) 博弈。我们通过优化一个自适应惩罚逻辑漂移的一致性调节势场,弥合模仿概率与逻辑真理之间的鸿沟。

### 2.1. 推理作为合作内源 MDP

为了为奖励分解提供严谨基础,我们将 LLM 的推理过程形式化为一个有限视界、离散时间的马尔可夫决策过程(MDP)(Garcia and Rachelson, 2013 (https://arxiv.org/html/2605.24005#bib.bib12)),记作 \(\mathcal{M}=\langle\mathcal{S},\mathcal{A},\mathcal{P},r,\gamma,H\rangle\)。对于给定查询 \(x\),第 \(h\) 步(\(h\in[1,H]\))的状态定义为 \(s_h=[x,a_1,\dots,a_{h-1}]\in\mathcal{S}\),它封装了初始提示以及到目前为止生成的推理轨迹片段。动作 \(a_h\in\mathcal{V}\) 对应于在第 \(h\) 步从模型词汇表 \(\mathcal{V}\) 中选择一个 token。转移函数 \(\mathcal{P}:\mathcal{S}\times\mathcal{A}\rightarrow\mathcal{S}\) 是确定性的,因此:

(1) \(s_{h+1}=[s_h,a_h]\).

我们假设基础模型 \(\pi_{\text{base}}\) 在其预训练期间隐式满足软贝尔曼一致性 (Xie et al., 2021 (https://arxiv.org/html/2605.24005#bib.bib40)),使其 logits \(f(s,a)\) 等价于潜在软 Q-函数 (Kang et al., 2025 (https://arxiv.org/html/2605.24005#bib.bib19)) \(\hat{Q}(s,a)\)。在最大熵 (Jaynes, 1982 (https://arxiv.org/html/2605.24005#bib.bib16)) RL 框架下,软状态价值函数 \(V(s)\) 定义如下:

(2) \(V(s)=\alpha\log\sum_{a'\in\mathcal{V}}\exp(\hat{Q}(s,a')/\alpha)\),

其中 \(\alpha\in\mathbb{R}^{+}\) 是控制熵正则化的温度参数;\(\hat{Q}(s,a')\) 表示未归一化的预测 logit (Pang and Jin, 2025 (https://arxiv.org/html/2605.24005#bib.bib28))。根据内源奖励假设,基本的基于模仿的奖励 \(\tilde{r}\) 通过逆软贝尔曼算子激发:

(3) \(\tilde{r}(s_h,a_h)=\alpha\log\pi_{\text{base}}(a_h|s_h) + V(s_h) - \gamma V(s_{h+1})\),

其中 \(\pi_{\text{base}}(a_h|s_h)\) 是给定状态 \(s_h\) 下动作 \(a_h\) 的条件概率;\(\gamma\in[0,1]\) 是折扣因子。式 (3) 的意图是从预训练语料库中提取“模仿信号” (Pang and Jin, 2025 (https://arxiv.org/html/2605.24005#bib.bib28))。然而,这种信号对结构逻辑是盲目的,因为它主要衡量统计可能性而非演绎可靠性,从而产生了**模仿偏差** (Zhou et al., 2025 (https://arxiv.org/html/2605.24005#bib.bib50))。

**备注 1:Logits 的理论基础**。预训练 logits \(f(s,a)\) 作为潜在软 Q-函数的假设基于最大熵(MaxEnt)RL 框架 (Eysenbach and Levine, 2021 (https://arxiv.org/html/2605.24005#bib.bib10))。我们在附录 A.1 中提供了形式化推导,证明标准的下一个 token 预测目标理论上等同于原则性的离线逆强化学习(IRL)目标。

### 2.2. 潜在逻辑专家(LLE)发现

为了解决缺乏外部逻辑锚点的问题,LC-ERD 通过**基于共识的挖掘协议** (Wu et al., 2026 (https://arxiv.org/html/2605.24005#bib.bib39)) 从模型自身的分布中激发动态专家流形。我们将模型的生成空间视为一个包含有效逻辑和幻觉的噪声数据集。对于给定的查询 \(x\),我们执行 \(K\) 次独立采样以生成候选集 \(\mathcal{T}=\{\tau^{(1)},\dots,\tau^{(K)}\}\)。我们识别已验证轨迹的子集 \(\mathcal{T}^*=\{\tau\in\mathcal{T}\mid\text{Ver}(\tau)=1\}\),这些轨迹满足终端逻辑约束。为了过滤随机噪声并提取稳定的逻辑核心,我们根据联合概率为每条成功路径分配置信权重 \(\omega(\tau)\):

(4) \(\omega(\tau)=\exp\left(\frac{1}{H}\sum_{h=1}^{H} \log \pi_{\text{base}}(a_h|s_h)/\tau_{\text{temp}}\right)\),

其中 \(H\) 是轨迹长度;\(\tau_{\text{temp}}\) 是平滑超参数,用于校准权重分布 (Li et al., 2025a (https://arxiv.org/html/2605.24005#bib.bib21))。**潜在逻辑专家**分布 \(\pi_{LLE}\) 构建如下:

(5) \(\pi_{LLE}(a_h|s_h) = \sigma\left(\frac{1}{\sum_k\omega(\tau^{(k)})} \sum_{\tau^{(k)}\in\mathcal{T}^*} \omega(\tau^{(k)}) \cdot \phi(s_h^{(k)},a_h)\right)\),

其中 \(\sigma\) 表示 softmax 算子;\(\phi(s_h^{(k)},a_h)\) 表示来自预训练模型的未归一化 logits。通过对多条成功路径进行边缘化,式 (5) 过滤了特异的幻觉并揭示了潜在的“逻辑骨干”。

**备注 2:无偏逻辑激发**。为了解决对“正确性幻觉”的担忧,LC-ERD 使用硬终端约束来过滤专家流形。我们在附录 A.4 中证明了该过程的渐近无偏性,形式上保证了增强的专家分布收敛于潜在逻辑真实值,从而建立了自我进化的可靠锚点。

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。