从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Hugging Face Daily Papers 论文

摘要

本文提出了轨迹增强策略优化(TAPO),该方法利用模型自身正确和错误的展开构建微反思修正轨迹,以提高大型语言模型的推理能力,在数学基准测试上优于标准自蒸馏方法。

自蒸馏通过将模型自身的展开作为训练信号来提高大型语言模型的推理能力,通常采用隐式logit级对齐,最小化相对于特权目标分布的KL散度。然而,由于这种监督是通过不受控制的采样生成的,因此它无法提供对模型具体错误的诊断性见解,也无法提供针对其个体失败模式的纠正性指导。因此,模型学会了模仿特权分布,而不是接收精确定位其推理失败的位置和原因的细粒度纠正。在本文中,我们提出了轨迹增强策略优化(TAPO),它将自蒸馏从隐式分布对齐推进到显式轨迹构建。在RL训练过程中,模型针对同一查询产生正确和错误的展开,TAPO利用这种对比结构构建微反思修正,即新的训练轨迹,这些轨迹保留模型在失败点之前的错误推理,然后插入由同一采样组中的正确参考引导的自然语言诊断和纠正后的推理。由于每条轨迹都基于学习者自身的前缀和解决方案,与基于KL的方法所施加的位置级对齐相比,纠正信号在更大程度上保留了模型的在策略分布。为了整合这些轨迹,TAPO在模型的能力边界引入了难度感知候选选择和解耦优势估计,以防止梯度污染。在AIME 2024、AIME 2025和HMMT 2025上的实验表明,在相同的训练步数下,TAPO比GRPO取得了持续的改进。进一步分析表明,TAPO增强了首次推理和纠错效果。
查看原文
查看缓存全文

缓存时间: 2026/06/23 05:41

论文页面 - 从自身错误中学习:构建可学习的微反思轨迹用于自蒸馏

来源:https://huggingface.co/papers/2606.18844

摘要

轨迹增强策略优化(TAPO)通过创建显式的纠正轨迹来增强大型语言模型的推理能力,这些轨迹在保留错误推理的同时融入自然语言诊断与修正,通过改进的错误纠正能力优于传统自蒸馏方法。

自蒸馏(https://huggingface.co/papers?q=Self-distillation)通过使用模型自身的 rollout 作为训练信号来改进大型语言模型的推理,通常采用隐式的 logit 层面对齐(https://huggingface.co/papers?q=logit-level%20alignment),最小化与特权目标分布之间的 KL 散度(https://huggingface.co/papers?q=KL%20divergence)。然而,由于这种监督是通过非受控采样生成的,它无法提供关于模型特定错误的诊断性洞察,也无法针对个体失败模式提供纠正性指导。因此,模型学会了模仿特权分布,而非接收精细化的修正——即精准指出推理失败的位置与原因。在本文中,我们提出了轨迹增强策略优化(https://huggingface.co/papers?q=Policy%20Optimization)(TAPO),它将自蒸馏(https://huggingface.co/papers?q=self-distillation)从隐式的分布对齐推进为显式的轨迹构建(https://huggingface.co/papers?q=trajectory%20construction)。在 RL 训练过程中,模型对同一查询同时产出正确和错误的 rollout,TAPO 利用这种对比结构来构建微反思修正(https://huggingface.co/papers?q=micro-reflective%20corrections),即新的训练轨迹:保留模型在失败点之前的错误推理,然后根据同一采样组中的正确参考插入自然语言诊断和修正后的推理。由于每条轨迹都锚定在学习者自身的前缀和解决方案上,纠正信号在更大程度上保持了模型的在线策略分布,优于基于 KL 的方法所施加的位置级对齐。为了整合这些轨迹,TAPO 引入了难度感知的候选选择(https://huggingface.co/papers?q=candidate%20selection)(位于模型能力边界)以及解耦的优势估计(https://huggingface.co/papers?q=advantage%20estimation),以防止梯度污染。在 AIME 2024、AIME 2025 和 HMMT 2025 上的实验表明,在相同训练步数下,TAPO 相较于 GRPO 取得了持续改进。进一步分析表明,TAPO 增强了首次推理和错误纠正效果(https://huggingface.co/papers?q=error-correction%20effectiveness)。

查看 arXiv 页面(https://arxiv.org/abs/2606.18844)查看 PDF(https://arxiv.org/pdf/2606.18844)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18844)

在你的 agent 中获取此论文:

hf papers read 2606\.18844

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.18844 以链接到此页面。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.18844 以链接到此页面。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.18844 以链接到此页面。

包含此论文的收藏1

相似文章

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。