Reflective Recovery: 一种通过从错误中学习进行推理的自监督方法

arXiv cs.CL 论文

摘要

本文介绍了Reflective Recovery,这是一种自监督方法,通过将失败轨迹转化为训练数据来增强LLM推理能力,打破缩放崩溃并实现涌现性自我纠正。

arXiv:2609.19156v1 公告类型:新 摘要:由于其简单性和效率,数据驱动微调被广泛用于增强大语言模型(LLM)的推理能力。然而,主流模仿学习方法完全依赖于完美的推理轨迹,存在缩放崩溃问题:当问题集有限时,增加正面示例无法带来持续改进。然而,在推理过程中,LLM无法保证每个中间步骤都是正确的,因此容易出错。一旦出现此类错误,LLM往往难以恢复,并可能被先前错误的积累进一步误导。为了解决这一问题,我们提出了Reflective Recovery,这是一种简单而有效的自监督方法,将失败的推理尝试转化为恢复训练数据。具体来说,我们提取失败轨迹的初始片段,将它们与提示连接起来,并用它们引导LLM找到有效解决方案。因为这些来自失败轨迹的片段可能包含错误,此过程教会模型在推理过程中识别和纠正错误,从而在不依赖外部评论者或奖励模型的情况下从错误状态中恢复。在广泛基准测试中进行评估,Reflective Recovery显著提高了性能。在DeepSeek-R1-Distill-Qwen-7B上,它将AIME 2025的准确率从30.0%提升到37.5%,Minerva的准确率从37.6%提升到47.8%。更重要的是,分析表明它打破了缩放崩溃的障碍,使模型能够发展出涌现性自我纠正行为,代表了从结果导向记忆到过程导向反思推理的范式转变。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:50

# 反思恢复:一种通过从错误中学习实现推理的自监督方法
来源:https://arxiv.org/html/2609.19156

Qirui Chen∗ 浙江大学 香港大学 [email protected]  
&Renjie Pi∗ 香港科技大学 [email protected]  
Jiahui Gao† 香港大学 [email protected]  
&Lingpeng Kong 香港大学 [email protected]

###### 摘要
数据驱动的微调因其简单高效,被广泛用于增强大型语言模型的推理能力。然而,主流模仿学习方法完全依赖于完美的推理轨迹,遭遇了**规模坍缩**问题:当问题集有限时,增加正面示例并不能带来持续改进。然而,在推理过程中,LLM无法保证每个中间步骤都正确,因此容易出错。一旦出现错误,LLM往往难以恢复,并可能被先前错误的累积进一步误导。为解决此问题,我们提出了**反思恢复**,一种简单有效的自监督方法,它将失败的推理尝试转化为恢复训练数据。具体而言,我们提取失败轨迹的初始片段,将其与提示连接,并用它们引导LLM找到有效解决方案。因为这些来自失败轨迹的片段可能包含错误,这一过程教会模型在推理过程中识别并纠正错误,从而能够从错误状态中恢复,无需依赖外部评判者或奖励模型。在广泛的基准测试中,反思恢复显著提升了性能。在DeepSeek-R1-Distill-Qwen-7B上,它将AIME 2025的准确率从30.0%提升至37.5%,Minerva的准确率从37.6%提升至47.8%。更重要的是,分析表明它打破了规模坍缩的障碍,使模型能够发展出涌现的自我纠正行为,代表了从基于结果的记忆到基于过程的反思推理的范式转变。

反思恢复:一种通过从错误中学习实现推理的自监督方法  
Qirui Chen∗ 浙江大学 香港大学 [email protected]  
Renjie Pi∗ 香港科技大学 [email protected]  
Jiahui Gao† 香港大学 [email protected]  
Lingpeng Kong 香港大学 [email protected]  
††脚注:∗同等贡献。†通讯作者。

## 1 引言
大型语言模型在多样化的自然语言任务中取得了显著进展,从问答到代码生成(Brown等人,2020(https://arxiv.org/html/2609.19156#bib.bib5);Grattafiori等人,2024(https://arxiv.org/html/2609.19156#bib.bib11))。在这些能力中,复杂推理作为解决多步数学问题和科学挑战的关键前沿脱颖而出(OpenAI等人,2024(https://arxiv.org/html/2609.19156#bib.bib27);DeepSeek-AI等人,2025(https://arxiv.org/html/2609.19156#bib.bib10);Anthropic,2023(https://arxiv.org/html/2609.19156#bib.bib3))。因此,增强LLM的推理能力受到了学术界和工业界的广泛关注。

在提升推理能力的多种方法(例如监督微调、强化学习)中,数据驱动的微调因其计算效率和训练简便性,已成为最普遍的解决方案。最近的大部分进展(Chen等人,2025(https://arxiv.org/html/2609.19156#bib.bib8);Bu等人,2025(https://arxiv.org/html/2609.19156#bib.bib6);Gulcehre等人,2023(https://arxiv.org/html/2609.19156#bib.bib12);Yang等人,2025(https://arxiv.org/html/2609.19156#bib.bib39))遵循模仿学习范式,其中**拒绝采样微调**最具代表性。RFT从大规模采样中收集高质量的、正确的推理轨迹作为训练的正面示例(Yuan等人,2023(https://arxiv.org/html/2609.19156#bib.bib42))。在初始对齐阶段,这种模仿方法可以在中等数据量下实现显著的性能提升。

然而,我们的实验揭示了这种纯正面模仿学习方法存在根本性的效率瓶颈。当问题集有限时,仅仅增加采样量以积累更多正面示例,并不能持续转化为模型能力的提升。例如,在AIME 2025基准测试中,随着训练数据量从8k增加到10k,RFT基线的性能实际上从35.3%下降到了30.0%。我们的实验表明,随着正面训练数据规模的增加,性能增益迅速减少并最终停滞——我们将这一现象称为**规模坍缩**(图2(https://arxiv.org/html/2609.19156#S4.F2))。尽管接触了更多正确路径,模型在复杂多步问题上仍然举步维艰。这暴露了模仿学习的根本局限:它引导模型记忆正确的推理轨迹,而不是发展出能泛化到记忆模式之外的、稳健的推理策略。

这种方法的局限性在模型偏离正确轨迹时变得尤为突出:由于训练数据从未包含错误状态,一旦模型做出不正确的推理步骤,它就缺乏任何自我纠正机制。有效的推理应该是一个动态过程,不仅需要生成正确的逻辑,还需要在错误出现时识别并纠正错误。

为了解决这个问题,最近的工作探索了鼓励恢复或自我纠正的机制。然而,依赖昂贵标注或使用额外模型进行外部反馈的方法(Kumar等人,2024(https://arxiv.org/html/2609.19156#bib.bib19);Wang等人,2025b(https://arxiv.org/html/2609.19156#bib.bib35))在可扩展性和自主性方面受限,而在完全失败后提示模型进行内在反思的方法(Shinn等人,2023(https://arxiv.org/html/2609.19156#bib.bib32))则缺乏在推理过程中进行中途纠正的能力。

在本文中,我们探索了一个更简单的替代方案:与其引入新的评判者或监督信号,我们研究模型能否直接从自身的失败中学习恢复。为此,我们引入了**反思恢复**,这是一个自监督框架,从失败的推理尝试中构建恢复训练数据。具体而言,给定一组导致错误答案的负向推理轨迹 $\mathcal{D}_{\text{neg}}$,我们提取它们的错误前缀——部分推理链。然后,我们将每个错误前缀与导致正确解决方案的正确续写配对。这一过程产生了一个反思数据集 $\mathcal{D}_{\text{rec}}$,其中每个训练实例由一个错误状态及其对应的恢复路径组成。通过在这些数据上训练,模型学会识别和纠正推理错误,从不正确的中间状态走向正确的解决方案。

尽管简单,反思恢复不需要外部奖励模型或强化学习,使其高度实用且可扩展。在AIME和Minerva等具有挑战性的基准测试上的实验表明,我们的方法优于基于结果的RFT基线。更重要的是,它表现出稳定和稳健的扩展行为,避免了标准模仿学习中观察到的性能饱和现象(图2(https://arxiv.org/html/2609.19156#S4.F2))。具体来说,当RFT基线在AIME 2025上的性能因训练数据从8k扩展到10k而从35.3%下降到30.0%时,我们的方法在Minerva等基准测试上保持了稳定提升,展示了泛化能力。

本文的主要贡献是:
- • 我们识别并表征了模仿学习中的**规模坍缩**现象,证明其根本原因在于缺乏错误恢复能力。
- • 我们引入了反思恢复,一个简单有效的自监督框架,将负向推理轨迹转化为学习恢复行为的高价值训练数据。
- • 广泛的实验证明,我们的方法在多个具有挑战性的基准测试上显著优于RFT。关键的是,与RFT遭受性能饱和不同,反思恢复在数据规模增加时保持了稳健的线性扩展行为(图2(https://arxiv.org/html/2609.19156#S4.F2))。
- • 通过归因分析,我们证明了我们的方法在模型中引出了动态的反思推理模式——在推理过程中主动检测错误并纠正推理路径(第4.5节(https://arxiv.org/html/2609.19156#S4.SS5))。

## 2 相关工作

##### 外部反馈。
增强LLM推理的一个方向是使用外部监督信号来指导生成过程。这通常涉及使用额外的组件或信号来使模型输出与正确性标准对齐,例如奖励模型或验证器(Kumar等人,2024(https://arxiv.org/html/2609.19156#bib.bib19);Akyürek等人,2023(https://arxiv.org/html/2609.19156#bib.bib1);Zhang等人,2025a(https://arxiv.org/html/2609.19156#bib.bib44);Wang等人,2025b(https://arxiv.org/html/2609.19156#bib.bib35);Jiang等人,2024b(https://arxiv.org/html/2609.19156#bib.bib18);Bensal等人,2025(https://arxiv.org/html/2609.19156#bib.bib4);Zhu等人,2025(https://arxiv.org/html/2609.19156#bib.bib47);An等人,2024(https://arxiv.org/html/2609.19156#bib.bib2))。这种反馈可用于评估推理步骤或答案。通过利用这些外部评判者,模型可以拒绝错误路径或通过强化学习进行微调以最大化奖励。

最近的进展转向在推理过程的每一步提供反馈,而不仅仅是在最终答案上。过程奖励模型提供中间步骤的监督,以引导模型走向正确推理(Lin等人,2025(https://arxiv.org/html/2609.19156#bib.bib25);Bensal等人,2025(https://arxiv.org/html/2609.19156#bib.bib4);Li等人,2025a(https://arxiv.org/html/2609.19156#bib.bib23))。这种步骤级反馈还支持自动生成推理数据,例如SRA-MCTS和GFlowNet等方法使用简单的验证器探索不同的推理路径并收集更高质量的训练样本(Xu等人,2025(https://arxiv.org/html/2609.19156#bib.bib38);Bu等人,2025(https://arxiv.org/html/2609.19156#bib.bib6))。然而,这些方法仍然依赖于精心设计的评判者或大量的人类偏好数据。对强外部监督和昂贵训练程序的需求限制了它们的可扩展性(Zhang等人,2024(https://arxiv.org/html/2609.19156#bib.bib46),2025b(https://arxiv.org/html/2609.19156#bib.bib45)),这促使了能够以最少外部指导运行的方法的发展。

##### 自我纠正与从错误中学习。
与外部监督并行的是,内在自我纠正关注模型精炼自身输出的能力。早期的推理时方法,如反思(Shinn等人,2023(https://arxiv.org/html/2609.19156#bib.bib32)),提示模型口头批评自己的答案。然而,先前研究表明,LLM常常难以识别自身的错误,特别是在多步或复杂推理任务中(Jiang等人,2024a(https://arxiv.org/html/2609.19156#bib.bib17)),自我纠正甚至可能在更具挑战性的基准测试上降低性能(Tie等人,2025(https://arxiv.org/html/2609.19156#bib.bib33);Lee等人,2024(https://arxiv.org/html/2609.19156#bib.bib21))。

为了克服这些限制,最近的工作转向使用负向信号进行基于训练的纠正。像SuperCorrect和RISE这样的方法在迭代精炼轨迹上微调模型(Yang等人,2025(https://arxiv.org/html/2609.19156#bib.bib39);Qu等人,2024(https://arxiv.org/html/2609.19156#bib.bib29);Wang等人,2025a(https://arxiv.org/html/2609.19156#bib.bib34))。其他方法训练模型避免不正确行为或从纠正后的推理路径中学习,这已被证明可以提高鲁棒性(Pi等人,2024(https://arxiv.org/html/2609.19156#bib.bib28);Chen等人,2025(https://arxiv.org/html/2609.19156#bib.bib8);Zhu等人,2025(https://arxiv.org/html/2609.19156#bib.bib47);Yu等人,2025(https://arxiv.org/html/2609.19156#bib.bib41);Li等人,2025b(https://arxiv.org/html/2609.19156#bib.bib24);Bui等人,2025(https://arxiv.org/html/2609.19156#bib.bib7);Liu等人,2025(https://arxiv.org/html/2609.19156#bib.bib26);Xiong等人,2025(https://arxiv.org/html/2609.19156#bib.bib37);Zelikman等人,2022(https://arxiv.org/html/2609.19156#bib.bib43);Shao等人,2025(https://arxiv.org/html/2609.19156#bib.bib31))。尽管有这些进展,大多数方法仍然是事后或结果导向的。这意味着它们只在错误完全发生后才进行干预,或者只是简单地阻止不正确的输出。因此,它们无法使模型在推理过程中主动检测错误并从中恢复。

## 3 方法
我们的方法**反思恢复**基于这样一个理念:稳健的推理不仅需要从正确的解决方案中学习,还需要学习如何从中间错误中恢复。我们认为,与其丢弃失败的推理路径,不如利用其中包含的丰富信息,并将其视为有价值的训练信号。基于这一见解,我们引入了一个自监督的**采样-重采样**范式,利用模型自身的失败轨迹作为学习资源,明确地教模型如何纠正自己。

如图1(https://arxiv.org/html/2609.19156#S3.F1)所示,我们的方法包含两个阶段:(1)提取多样的推理轨迹以识别失败轨迹,将其保留为潜在的恢复机会;(2)将失败轨迹转化为成功的、自我纠正的轨迹,以构建以恢复为重点的训练数据集 $\mathcal{D}_{\text{rec}}$。

### 3.1 失败轨迹收集
为了实现恢复学习,我们首先收集模型错误的数据集。设 $\mathcal{M}$ 为基础语言模型,$\mathcal{X}$ 为种子问题集。在探索阶段,对于每个问题 $x \in \mathcal{X}$,我们使用采样解码生成 $N$ 条推理轨迹 $\{y_1, y_2, \dots, y_N\}$。通过使用高温度并利用模型的不确定性,我们收集包含多样化错误的失败轨迹。接下来,我们使用二元结果验证器 $\mathcal{V}(x, y) \in \{0, 1\}$ 评估每条轨迹的正确性。根据验证结果,我们将轨迹划分为一组正确解 $\mathcal{D}_{\text{pos}} = \{(x, y) \mid \mathcal{V}(x, y) = 1\}$ 和一组失败轨迹 $\mathcal{D}_{\text{neg}} = \{(x, y) \mid \mathcal{V}(x, y) = 0\}$。与通常丢弃 $\mathcal{D}_{\text{neg}}$ 的标准基于结果的方法不同,我们保留这些失败轨迹,因为它们揭示了模型特定的错误模式。通过研究模型如何失败,我们可以明确地教导它如何从错误中恢复。

图1:反思恢复流程。我们进行两个阶段:(1)失败轨迹收集。我们应用多样化采样提取失败轨迹($\mathcal{D}_{\text{neg}}$)

相似文章