SuCo:基于充分性的连续自适应推理
摘要
介绍 SuCo,一种用于大型推理模型的两阶段训练框架,该框架利用最小充分思维链(Minimal Sufficient CoT)的概念,在减少推理令牌数的同时,提高数学、代码和科学基准测试上的准确性。
arXiv:2606.17687v1 公告类型:new
摘要:尽管大型推理模型(LRMs)在复杂任务上表现卓越,但它们常常生成过长的思维链(CoT),甚至对简单查询也会大幅增加计算成本。现有的缓解这种低效性的方法通常依赖离散的推理模式或固定预算层级,缺乏判断推理何时充分的原理性标准。在这项工作中,我们引入了最小充分思维链(MSC),定义为 CoT 轨迹中最短的前缀,该前缀足以产生正确答案。我们通过实验表明,MSC 不仅减少了推理令牌数,还提高了不同难度级别的准确性。基于 MSC,我们提出了充分性引导的连续自适应推理(SuCo),这是一个两阶段训练框架,用于沿着连续谱进行自主推理控制。在第一阶段,MSC对齐微调(MFT)利用问题自适应充分性阈值(该阈值会根据问题难度自然缩放)构建 MSC 数据,然后对模型进行微调,使其内化简洁且充分的推理模式。在第二阶段,充分性感知策略优化(SAPO)通过强化学习进一步优化模型,采用动态复杂性跟踪和充分性感知奖励,对过度思考和思考不足都进行惩罚。在数学、代码和科学基准测试上的大量实验表明,SuCo 在准确性和推理效率方面均持续取得改进。
查看缓存全文
缓存时间: 2026/06/17 05:41
# SuCo: 充分性引导的连续自适应推理
来源: https://arxiv.org/html/2606.17687
Bingyu Liang, Chenhao Hu, Longhui Zhang, Xuebo Liu, Min Zhang, Jing Li, Xuelong Li
###### 摘要
尽管大推理模型(LRMs)在复杂任务上表现出色,但它们常常生成过长的思维链(CoT),即使对于简单查询也会增加计算成本。现有的缓解这种低效性的努力通常依赖于离散的推理模式或固定的预算层级,缺乏关于何时推理是充分的这一原则性标准。在这项工作中,我们引入了*最小充分CoT*(MSC),定义为CoT轨迹中足以产生正确答案的最短前缀。我们经验性地证明,MSC不仅减少了推理token数量,而且在各个难度级别上都提高了准确率。基于MSC,我们提出了*充分性引导的连续自适应推理*(SuCo),这是一个两阶段训练框架,用于沿连续谱进行自主推理控制。在第一阶段,*MSC对齐微调*(MFT)使用自然随问题难度缩放的问题自适应充分性阈值构建MSC数据,然后微调模型以内化简洁而充分的推理模式。在第二阶段,*充分性感知策略优化*(SAPO)通过强化学习进一步优化模型,其中包含动态复杂度跟踪和充分性感知奖励,对过度思考和思考不足都进行惩罚。在数学、代码和科学基准上的大量实验表明,SuCo在准确率和推理效率上都取得了一致的提升。
机器学习,ICML
## 1. 引言
大语言模型(LLMs)在广泛的任务中展现了令人印象深刻的能力(Zhao et al., 2023; Wang et al., 2025a; Zhang et al., 2025c),但在需要多步推理的复杂问题上仍然困难重重(Cobbe et al., 2021)。为了解决这一局限,最近的工作引入了*大推理模型*(LRMs),它们通过思维链(CoT)显式地生成中间推理步骤(Wei et al., 2022)。通过在得出最终答案之前执行逐步逻辑思考,诸如DeepSeek-R1(Guo et al., 2025)和OpenAI o1(Jaech et al., 2024)等LRMs在具有挑战性的基准上取得了相较于标准LLMs的显著提升(Hou et al., 2025b; Xu et al., 2025)。
图1:Qwen3-8B在MATH各难度级别上的MSC与完整CoT对比。左轴(↓):推理token数。右轴(↑):准确率。在每个难度级别,MSC以显著更少的token实现了更高的准确率。
尽管取得了这些进展,当前的LRMs仍然存在*冗余推理*问题(Sui et al., 2025)。即使对于简单的查询,它们也倾向于生成详尽的推理链,导致大量的计算成本和推理延迟(Aggarwal & Welleck, 2025)。这种低效性限制了其在实时应用(例如在线编程助手(Jimenez et al., 2024))和资源受限环境(例如边缘设备(Zhang et al., 2024))中的实际部署。为了缓解冗余,最近的研究开发了*自适应大推理模型*(ALRMs),旨在根据问题复杂度调整推理努力(Sui et al., 2025; Wu et al., 2025)。这些方法大致可以分为两类范式。*用户控制方法*需要显式提示来选择推理行为。例如,Qwen3(Qwen团队,2025)支持手动开/关切换,而GPT-OSS(OpenAI,2025)提供了多种预定义的推理策略。相比之下,*模型驱动方法*允许自主推理决策。AdaCoT(Lou et al., 2025)使用外部评估器,而LHRM(Jiang et al., 2025)根据领域标签分配推理状态。尽管存在差异,现有的ALRMs根本上依赖于离散模式选择。推理努力是通过在有限的手动指定选项之间切换来调整的,而不是以连续的方式校准。我们认为理想的ALRM需要:(1) 推理长度随问题难度缩放,(2) 无需干预的自主资源分配,以及 (3) 以最小推理实现最优性能。然而,这引出了一个反直觉的问题:根据测试时缩放定律(Snell et al., 2025; Brown et al., 2024),性能通常随着更多推理而提高。模型真的能以更少的推理表现得更好吗?我们通过引入*最小充分CoT*(MSC)——一个CoT轨迹中足以产生正确答案的最短推理前缀——给出了肯定的答案。如图1所示,在MATH基准(Hendrycks et al., 2021b)的全部五个难度级别上,MSC大幅减少了推理token数量,同时在准确率上始终优于完整CoT。这表明,测试时自适应提供了一种比盲目扩展推理资源更高效的解决方案。基于这一洞察,我们提出了充分性引导的连续自适应推理(SuCo),这是一个实现连续推理控制的两阶段训练框架。与先前依赖外部分类器或预定义预算层级的离散方法不同,SuCo引入了问题自适应充分性阈值,自然地根据问题难度进行调整。在第一阶段,*MSC对齐微调*(MFT)从完整的CoT轨迹构建MSC数据集,然后进行监督微调(SFT)以内化简洁而充分的推理模式。在第二阶段,*充分性感知策略优化*(SAPO)通过强化学习(RL)进一步训练模型动态分配推理努力。关键在于,SAPO维护了一个动态复杂度池来跟踪训练期间不断演化的推理分布,并使用充分性感知奖励来惩罚不充分和过度的推理。我们在1.5B和7B两种模型规模上,在数学、代码和科学领域进行了大量实验。结果表明,SuCo以显著更少的推理token实现了优越的准确率,优于完整CoT和ALRM基线。我们的主要贡献总结如下:
- • 我们形式化了MSC,提供了一个原则性的充分性准则,揭示了模型可以通过更少的推理实现更强的性能。
- • 我们提出了SuCo,一种用于连续、自主推理控制的两阶段训练范式,无需离散模式或外部干预。
- • 涵盖多个领域的全面实验证明了我们SuCo的有效性。
## 2. 相关工作
#### 大推理模型。
大推理模型(LRMs)通过思维链(CoT)显式生成中间推理步骤来扩展大语言模型(LLMs),这已被证明能显著提升在具有挑战性的多步任务上的性能(Wei et al., 2022; Kojima et al., 2022)。基于这一范式,最近的LRMs如DeepSeek-R1(Guo et al., 2025)、OpenAI o1(Jaech et al., 2024)和Qwen3(Qwen团队,2025)通过在高质量CoT数据上进行大规模监督微调(SFT),通常结合带有精心设计奖励的强化学习(RL),进一步增强了推理能力。尽管取得了这些进展,当前的LRMs即使对于简单查询也常常产生不必要的冗长推理,导致显著的推理开销,从而激发了对更高效推理控制的需求。
#### 自适应大推理模型。
为了缓解推理冗余,最近的研究探索了根据问题难度调节推理长度的自适应大推理模型(ALRMs)。早期方法主要关注推理的*二元触发*。AdaCoT(Lou et al., 2025)使用外部模型来决定是否激活CoT;AdaptThink(Zhang et al., 2025b)将推理激活形式化为一个约束优化问题;LHRMs(Jiang et al., 2025)使用粗略的领域级标签(例如,数学 vs. 聊天)来分配推理行为。超越二元控制,后续方法研究了*多模式推理*。SABER(Zhao et al., 2025)和ThinkDial(He et al., 2025)引入了多个预定义的推理策略或预算层级,通过系统提示选择。最近的其他工作探索了更细粒度的控制。ThinkPrune(Hou et al., 2025a)应用强化学习来修剪长的推理链,而CyclicReflex(Fan et al., 2026)循环调度反思token以平衡深度和效率。AlphaOne(Zhang et al., 2025a)探索了测试时的双速推理,使模型能够自适应地快或慢思考。补充分析也突出了*思考不足*(Wang et al., 2025b)和测试时缩放幻象(Ghosal et al., 2026)等现象,这进一步激发了对推理努力进行原则性控制的需求。尽管取得了进展,现有的ALRMs共享一个根本性的局限:推理努力通过离散指定的模式进行调节,依赖于粗略的监督信号,如外部估计器、预定义的数据类别或启发式的长度约束。这种离散控制忽略了推理轨迹内部的逻辑充分性,并且缺乏以问题特定方式精细校准推理深度的灵活性。相比之下,我们的工作提出了基于*最小充分CoT*(MSC)概念的*连续自适应推理*。通过引入一个原则性的充分性准则,我们能够细粒度地评估推理前缀是否足以支持一个可信的答案。与离散模式或固定的截断规则不同,我们的充分性感知训练使模型能够沿连续谱自主校准其推理努力。
图2:最小充分CoT(MSC)的图示。对于给定问题,在每个生成位置计算充分性分数(真实答案token的几何均值)。MSC是超过自适应阈值δ的最短前缀。如图所示,一旦达到充分性阈值,扩展的*等待*或自我验证步骤会导致充分性迅速下降,表明额外的推理几乎没有益处,甚至可能降低置信度。
## 3. 方法论
### 3.1 问题形式化
#### 符号。
考虑一个数据集D,包含问答对 \((x, y^*)\),其中 \(x\) 表示输入问题,\(y^*\) 是真实答案。给定 \(x\),推理模型 \(\pi_\theta\) 生成一个CoT轨迹 \(z = (z_1, z_2, \ldots, z_{L_z})\),有 \(L_z\) 个句子和总共 \(\|z\|\) 个token。以 \(x\) 和 \(z\) 为条件,模型生成最终答案:\(y \sim \pi_\theta(\cdot \mid x, z)\)。
### 3.2 MSC:最小充分CoT
图2提供了MSC的直观图示。
#### 推理充分性。
为了量化推理轨迹在多大程度上支持真实答案,我们定义*推理充分性*:
\[ S_\theta(z \mid x, y^*) := \left( \prod_{i=1}^{\|y^*\|} \pi_\theta(y_i^* \mid x, z, y_{<i}^*) \right)^{1/\|y^*\|} \]
(此处及以下公式保留原格式,但翻译时若出现公式外的文本则翻译。注意公式环境保持原样。)
#### MSC数据构建。
对于每个训练样本 \((x_i, y_i^*)\),我们使用当前模型 \(\pi_\theta\) 生成完整CoT轨迹 \(z_i^{\text{full}}\)。然后,我们计算充分性分数 \(S_\theta(z_{i,j} \mid x_i, y_i^*)\),其中 \(z_{i,j}\) 是第 \(j\) 个句子后的前缀。MSC定义为满足充分性阈值的第一个前缀:
\[ z_i^{\text{MSC}} = \arg\min_{j} \|z_{i,j}\| \quad \text{s.t.} \quad S_\theta(z_{i,j} \mid x_i, y_i^*) \ge \delta(x_i) \]
其中 \(\delta(x_i)\) 是自适应阈值,定义为问题平均充分性分数:
\[ \delta(x_i) = \mathbb{E}_{y \sim \pi_\theta(\cdot \mid x_i, z_i^{\text{full}})} [S_\theta(z_i^{\text{full}} \mid x_i, y)] \]
自适应阈值确保MSC根据不同问题的难度定义合理的充分性标准。对于需要简单操作的问题,阈值较高,允许较短推理;对于复杂问题,阈值较低,允许更多推理步骤。
### 3.3 第一阶段:MSC对齐微调
在第一阶段,我们构建一个MSC数据集 \(\mathcal{D}_{\text{MSC}} = \left\{ \left( x_i, \, z_i^{\text{MSC}}, \, \hat{y}_i \right) \right\}_{i=1}^N\),其中 \(z_i^{\text{MSC}}\) 可能是空的(对于不需要推理的问题)。完整过程见算法1。
#### 监督微调。
我们通过最小化 \(\mathcal{D}_{\text{MSC}}\) 上的负对数似然来微调基础模型:
\[ \mathcal{L}_{\text{MFT}}(\theta) = -\mathbb{E}_{(x_i, z_i^{\text{MSC}}, \hat{y}_i) \sim \mathcal{D}_{\text{MSC}}} \left[ \log \pi_\theta(z_i^{\text{MSC}} \mid x_i) + \log \pi_\theta(\hat{y}_i \mid x_i, z_i^{\text{MSC}}) \right] \]
### 3.4 第二阶段:充分性感知策略优化
在第二阶段,称为充分性感知策略优化(SAPO),我们通过带有动态复杂度池和充分性感知奖励的强化学习来训练模型在推理过程中分配推理步骤。我们基于组相对策略优化(GRPO)(Shao et al., 2024),它每个问题采样多个轨迹以实现鲁棒的组内优势估计。
#### 动态复杂度池。
将MSC整合到在线RL中的一个关键挑战是,随着策略的演化,推理长度分布会发生变化。MFT阶段的离线复杂度估计变得过时。在每次梯度步骤后重新计算整个数据集上的复杂度在计算上是不可行的。相反,我们维护一个在线*动态复杂度池* \(\mathcal{P} = \{ \|z_i^{\text{avg}}\| \}_{i=1}^N\),跟踪每个问题 \(x_i\) 演化的推理长度。该池由 \(\pi_{\text{MFT}}\) 在RL训练数据上初始化,即 \(\|z_i^{\text{avg}}\| \leftarrow \mathbb{E}_{z \sim \pi_{\text{MFT}}(\cdot | x_i)} [\|z\|]\)。对于每个训练批次,我们通过指数移动平均(EMA)更新池:
\[ \|z_i^{\text{avg}}\| \leftarrow (1 - \eta) \cdot \|z_i^{\text{avg}}\| + \eta \cdot \frac{1}{K} \sum_{k=1}^K \|z_i^{(k)}\| \]
其中 \(\eta \in [0,1]\) 控制更新率,\(\{z_i^{(k)}\}_{k=1}^K\) 是当前批次中 \(x_i\) 的 \(K\) 个推出轨迹。从 \(\mathcal{P}\) 中,我们通过公式4重新计算复杂度分数 \(\mathcal{C}(x_i)\) 和阈值 \(\delta(x_i)\)。相似文章
有限监督下的链式思维推理再探讨:半监督链式思维学习
本文介绍了Semi-CoT,一种用于链式思维推理的半监督学习框架,该框架利用未标记问题并通过基于熵的选择生成可靠的伪推理链,在数学推理基准上展示了有希望但混合的结果。
OpenCoF:通过视频生成学习推理
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
通过简单统一缩放实现金牌级奥赛推理
一篇介绍SU-01的论文,该模型为30B-A3B推理模型,通过反向困惑度课程、两阶段强化学习和测试时缩放,在IMO和IPhO问题上达到金牌级表现。
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
通过简单统一的缩放实现金牌级奥赛推理
本文提出了一种简单统一的配方,结合监督微调、两阶段强化学习和测试时缩放,训练出一个推理模型(SU-01),在国际数学和物理奥林匹克竞赛中达到金牌级表现。