ReflectRL:通过反思到直接推理从黄金负轨迹中学习

Hugging Face Daily Papers 论文

摘要

ReflectRL是一种通过反思“黄金负轨迹”(专家模型失败的推理尝试)来学习的框架,随后将这种反思性推理迁移回直接推理,从而在多个基准上提升大语言模型的性能。

同策略训练(on-policy training)已成为提升大语言模型推理能力的一种强大的后训练范式,并且通常借助来自更强专家模型的黄金轨迹来增强。然而,当专家在更难的问题上失败时,现有的轨迹引导方法会失去其主要监督来源,而这些失败的轨迹通常被当作负样本丢弃。我们认为,这些失败——我们称之为黄金负轨迹——如果被视作值得反思的有缺陷轨迹,而不是作为模仿的示范,仍然可以提供有价值的推理信号。我们发现了“反思优势”:对于困难问题,对一条有缺陷的轨迹进行反思,比从头直接解决问题更容易、更有效。基于此,我们提出了ReflectRL,一个轻量级、即插即用的框架,在同策略训练中从黄金负轨迹中学习。ReflectRL首先利用这些轨迹引出反思性推理,然后应用“反思到直接策略转换”,将所获得的推理行为迁移回直接推理。在9个基准、4个LLM骨干网络和4种同策略训练方法上的实验表明,ReflectRL能够以极小的开销持续提升推理性能。
查看原文
查看缓存全文

缓存时间: 2026/08/05 17:46

论文页面 - ReflectRL:通过反思到直接推理从黄金负轨迹中学习

来源:https://huggingface.co/papers/2608.03972 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

在线策略训练已成为一种强大的事后训练范式,用于提升大型语言模型的推理能力,并且通常借助来自更强专家模型的黄金轨迹来增强。然而,当专家在更困难的问题上失败时,现有的轨迹引导方法会失去其主要监督来源,而这些失败轨迹通常作为负样本被丢弃。我们认为,这类失败——我们称之为黄金负轨迹——如果被视作需要反思的有缺陷轨迹,而非需要模仿的示范,仍然可以提供有价值的推理信号。我们识别出一种“反思优势”:对于困难问题,反思一条有缺陷的轨迹可能比从头直接解决问题更容易、更有效。受此启发,我们提出了 ReflectRL,一个轻量级的即插即用框架,可在在线策略训练期间从黄金负轨迹中学习。ReflectRL 首先利用这些轨迹引发反思性推理,然后应用从反思到直接策略的迁移,将所学到的推理行为迁移回直接推理。在 9 个基准、4 个 LLM 主干网络和 4 种在线策略训练方法上的实验表明,ReflectRL 能以极低的额外开销持续提升推理性能。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03972)查看 PDF (https://arxiv.org/pdf/2608.03972)GitHub1 (https://github.com/bibisbar/ReflectRL)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03972)

在你的智能体中获取这篇论文:

hf papers read 2608\.03972

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有关联此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.03972,即可从本页链接到它。

引用此论文的数据集 0

没有关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.03972,即可从本页链接到它。

引用此论文的 Spaces 0

没有关联此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.03972,即可从本页链接到它。

包含此论文的收藏集 0

没有包含此论文的收藏集

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,即可从本页链接到它。

相似文章