ReflectRL:通过反思到直接推理从黄金负轨迹中学习
摘要
ReflectRL是一种通过反思“黄金负轨迹”(专家模型失败的推理尝试)来学习的框架,随后将这种反思性推理迁移回直接推理,从而在多个基准上提升大语言模型的性能。
查看缓存全文
缓存时间: 2026/08/05 17:46
论文页面 - ReflectRL:通过反思到直接推理从黄金负轨迹中学习
来源:https://huggingface.co/papers/2608.03972 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
在线策略训练已成为一种强大的事后训练范式,用于提升大型语言模型的推理能力,并且通常借助来自更强专家模型的黄金轨迹来增强。然而,当专家在更困难的问题上失败时,现有的轨迹引导方法会失去其主要监督来源,而这些失败轨迹通常作为负样本被丢弃。我们认为,这类失败——我们称之为黄金负轨迹——如果被视作需要反思的有缺陷轨迹,而非需要模仿的示范,仍然可以提供有价值的推理信号。我们识别出一种“反思优势”:对于困难问题,反思一条有缺陷的轨迹可能比从头直接解决问题更容易、更有效。受此启发,我们提出了 ReflectRL,一个轻量级的即插即用框架,可在在线策略训练期间从黄金负轨迹中学习。ReflectRL 首先利用这些轨迹引发反思性推理,然后应用从反思到直接策略的迁移,将所学到的推理行为迁移回直接推理。在 9 个基准、4 个 LLM 主干网络和 4 种在线策略训练方法上的实验表明,ReflectRL 能以极低的额外开销持续提升推理性能。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03972)查看 PDF (https://arxiv.org/pdf/2608.03972)GitHub1 (https://github.com/bibisbar/ReflectRL)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03972)
在你的智能体中获取这篇论文:
hf papers read 2608\.03972
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有关联此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.03972,即可从本页链接到它。
引用此论文的数据集 0
没有关联此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.03972,即可从本页链接到它。
引用此论文的 Spaces 0
没有关联此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.03972,即可从本页链接到它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,即可从本页链接到它。
相似文章
Reflective Recovery: 一种通过从错误中学习进行推理的自监督方法
本文介绍了Reflective Recovery,这是一种自监督方法,通过将失败轨迹转化为训练数据来增强LLM推理能力,打破缩放崩溃并实现涌现性自我纠正。
ReflectMT:将反思内化为高效高质量机器翻译
ReflectMT提出两阶段强化学习方法,让大推理模型把反思能力内化,实现单次高质量翻译,比DeepSeek-R1等多步推理模型少用94%的token。
ReFlect:用于复杂长周期大语言模型推理的有效包装系统
本文介绍了 ReFlect,这是一种无需训练的包装系统,通过为大语言模型包裹确定性的错误检测与恢复逻辑,来提升其在复杂、长周期推理任务上的性能。
ResRL:通过负样本投影残差强化学习提升大语言模型的推理能力
本文介绍了 ResRL,一种通过负样本投影解耦正负回复之间语义分布,从而提升大语言模型(LLM)推理能力的方法。该方法旨在改善各项基准测试性能的同时,保持生成的多样性。
通过反思增强自蒸馏在稀有成功但反馈丰富的场景中学习
本文介绍了反思增强自蒸馏(RESD)框架,该框架将失败反馈转化为对LLM的纠正性监督,从而实现从稀有成功中高效学习。该框架优于标准自蒸馏基线,并且相比GRPO,使用更少的样本实现了更快的早期改进。