Cliff:从首个错误中学习过程奖励
摘要
Cliff 通过使用现成的大型语言模型(LLM)检测首个推理错误并塑造 token 级别的优势,从而改进具有可验证奖励的强化学习,相比现有方法带来持续的性能提升。
查看缓存全文
缓存时间: 2026/09/03 03:51
论文页面 - Cliff:从首个错误中学习过程奖励
来源:https://huggingface.co/papers/2609.02817 发布于 9月2日
·
提交者:https://huggingface.co/HakHan
韩沛煊 (https://huggingface.co/HakHan),于 9月3日
摘要
Cliff 通过使用现成的语言模型来检测首个推理错误,并相应塑造词元级优势,从而改进了基于可验证奖励的强化学习。
基于可验证奖励的强化学习 (https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards)(RLVR)已成为大语言模型(LLM)后训练的强大范式,但其依赖于粗糙的结果奖励,对中间推理过程提供的指导有限。现有方法,如过程奖励建模 (https://huggingface.co/papers?q=process%20reward%20modeling) 和策略内蒸馏 (https://huggingface.co/papers?q=on-policy%20distillation),引入了额外的约束,例如依赖专门的奖励模型或假设教师与学生之间存在相同的推理模式。然而,我们观察到,一旦推理过程首次出错,评估后续推理所提供的额外信息有限,因为它已经基于无效的前缀。因此,我们提出了 Cliff,一种奖励塑造 (https://huggingface.co/papers?q=reward%20shaping) 策略,它利用现成的 LLM 作为教师来识别每个生成序列中的第一个错误。结果,该生成序列自然地被分解为两部分:一个正确的前缀和一个错误的后缀。Cliff 然后将此信号转换为词元级优势 (https://huggingface.co/papers?q=token-level%20advantages),为正确的前缀分配正优势,而为之后的部分分配负反馈。在 12 种不同场景下的实验表明,Cliff 持续提升了推理性能,即使使用能力一般的教师模型,其表现也优于策略内蒸馏 (https://huggingface.co/papers?q=on-policy%20distillation) 15%,优于标准的 GRPO (https://huggingface.co/papers?q=GRPO) 7%。此外,我们分析了“ground truth”在 Cliff 中的作用,并研究了其训练动态。这些结果表明,Cliff 是一种简单、通用且有效的方法,能通过更丰富、细粒度的监督来改进 RLVR。
查看 arXiv 页面 (https://arxiv.org/abs/2609.02817) 查看 PDF (https://arxiv.org/pdf/2609.02817) 项目页面 (https://x.com/peixuanhakhan/status/2095334137909359011) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.02817)
在您的 agent 中获取此论文:
hf papers read 2609\.02817
没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.02817 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.02817 以从此页面链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.02817 以从此页面链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
提出了面向纠正的策略优化(CIPO),这是对RLVR的一种扩展,它将失败轨迹转化为面向纠正的监督信号,从而在数学和代码基准测试中提升LLM的推理与纠错能力。
Reflective Recovery: 一种通过从错误中学习进行推理的自监督方法
本文介绍了Reflective Recovery,这是一种自监督方法,通过将失败轨迹转化为训练数据来增强LLM推理能力,打破缩放崩溃并实现涌现性自我纠正。
元认知作为奖励:通过知识与调控信号强化大语言模型推理
介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。
@ickma2311:CMU 高级 NLP:强化学习 我一直好奇 RL 如何作用于大模型,而这门 CMU 课程让我豁然开朗……
CMU 高级 NLP 课程讲清了强化学习如何优化整个输出的奖励(正确性、有用性、安全性),而非预训练/微调阶段的下一个 token 预测。