从自身错误中学习:为自蒸馏构建可学习的微反思轨迹
摘要
本文提出了轨迹增强策略优化(TAPO),该方法利用模型自身正确和错误的展开构建微反思修正轨迹,以提高大型语言模型的推理能力,在数学基准测试上优于标准自蒸馏方法。
查看缓存全文
缓存时间: 2026/06/23 05:41
论文页面 - 从自身错误中学习:构建可学习的微反思轨迹用于自蒸馏
来源:https://huggingface.co/papers/2606.18844
摘要
轨迹增强策略优化(TAPO)通过创建显式的纠正轨迹来增强大型语言模型的推理能力,这些轨迹在保留错误推理的同时融入自然语言诊断与修正,通过改进的错误纠正能力优于传统自蒸馏方法。
自蒸馏(https://huggingface.co/papers?q=Self-distillation)通过使用模型自身的 rollout 作为训练信号来改进大型语言模型的推理,通常采用隐式的 logit 层面对齐(https://huggingface.co/papers?q=logit-level%20alignment),最小化与特权目标分布之间的 KL 散度(https://huggingface.co/papers?q=KL%20divergence)。然而,由于这种监督是通过非受控采样生成的,它无法提供关于模型特定错误的诊断性洞察,也无法针对个体失败模式提供纠正性指导。因此,模型学会了模仿特权分布,而非接收精细化的修正——即精准指出推理失败的位置与原因。在本文中,我们提出了轨迹增强策略优化(https://huggingface.co/papers?q=Policy%20Optimization)(TAPO),它将自蒸馏(https://huggingface.co/papers?q=self-distillation)从隐式的分布对齐推进为显式的轨迹构建(https://huggingface.co/papers?q=trajectory%20construction)。在 RL 训练过程中,模型对同一查询同时产出正确和错误的 rollout,TAPO 利用这种对比结构来构建微反思修正(https://huggingface.co/papers?q=micro-reflective%20corrections),即新的训练轨迹:保留模型在失败点之前的错误推理,然后根据同一采样组中的正确参考插入自然语言诊断和修正后的推理。由于每条轨迹都锚定在学习者自身的前缀和解决方案上,纠正信号在更大程度上保持了模型的在线策略分布,优于基于 KL 的方法所施加的位置级对齐。为了整合这些轨迹,TAPO 引入了难度感知的候选选择(https://huggingface.co/papers?q=candidate%20selection)(位于模型能力边界)以及解耦的优势估计(https://huggingface.co/papers?q=advantage%20estimation),以防止梯度污染。在 AIME 2024、AIME 2025 和 HMMT 2025 上的实验表明,在相同训练步数下,TAPO 相较于 GRPO 取得了持续改进。进一步分析表明,TAPO 增强了首次推理和错误纠正效果(https://huggingface.co/papers?q=error-correction%20effectiveness)。
查看 arXiv 页面(https://arxiv.org/abs/2606.18844)查看 PDF(https://arxiv.org/pdf/2606.18844)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18844)
在你的 agent 中获取此论文:
hf papers read 2606\.18844
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.18844 以链接到此页面。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.18844 以链接到此页面。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.18844 以链接到此页面。
包含此论文的收藏1
相似文章
Reflective Recovery: 一种通过从错误中学习进行推理的自监督方法
本文介绍了Reflective Recovery,这是一种自监督方法,通过将失败轨迹转化为训练数据来增强LLM推理能力,打破缩放崩溃并实现涌现性自我纠正。
TISD:基于轨迹干预的同策略自蒸馏
TISD 介绍了一种基于轨迹干预的同策略自蒸馏方法,通过允许教师指导的分支来提高大型语言模型在编码和科学任务中的性能。
通过反思增强自蒸馏在稀有成功但反馈丰富的场景中学习
本文介绍了反思增强自蒸馏(RESD)框架,该框架将失败反馈转化为对LLM的纠正性监督,从而实现从稀有成功中高效学习。该框架优于标准自蒸馏基线,并且相比GRPO,使用更少的样本实现了更快的早期改进。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
提出了面向纠正的策略优化(CIPO),这是对RLVR的一种扩展,它将失败轨迹转化为面向纠正的监督信号,从而在数学和代码基准测试中提升LLM的推理与纠错能力。