Cliff:从首个错误中学习过程奖励

Hugging Face Daily Papers 论文

摘要

Cliff 通过使用现成的大型语言模型(LLM)检测首个推理错误并塑造 token 级别的优势,从而改进具有可验证奖励的强化学习,相比现有方法带来持续的性能提升。

具有可验证奖励的强化学习(RLVR)已成为大型语言模型(LLM)后训练的强大范式,但其依赖粗粒度的结果奖励导致对中间推理过程的指导有限。现有方法如过程奖励建模和在策略蒸馏引入了额外的约束,例如依赖专门的奖励模型或假设教师和学生具有相同的推理模式。然而,我们观察到,一旦推理过程首次出错,评估后续推理提供的额外信息有限,因为它已经基于无效的前缀。因此,我们提出Cliff,一种奖励塑造策略,利用现成的LLM作为教师来识别每个生成过程中的首个错误。结果,生成过程自然分解为两部分:正确的前缀和错误的后缀。Cliff然后将此信号转换为token级别的优势,为正确的前缀分配正优势,之后分配负反馈。在12种不同场景中的实验表明,Cliff持续提升推理性能,比在策略蒸馏高出15%,比标准GRPO高出7%,即使使用能力适中的教师。此外,我们分析了``ground truth''在Cliff中的作用并研究了其训练动态。这些结果确立了Cliff作为一种简单、通用且有效的方法,通过更丰富、细粒度的监督来改进RLVR。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:51

论文页面 - Cliff:从首个错误中学习过程奖励

来源:https://huggingface.co/papers/2609.02817 发布于 9月2日

·

提交者:https://huggingface.co/HakHan

韩沛煊 (https://huggingface.co/HakHan),于 9月3日

摘要

Cliff 通过使用现成的语言模型来检测首个推理错误,并相应塑造词元级优势,从而改进了基于可验证奖励的强化学习。

基于可验证奖励的强化学习 (https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards)(RLVR)已成为大语言模型(LLM)后训练的强大范式,但其依赖于粗糙的结果奖励,对中间推理过程提供的指导有限。现有方法,如过程奖励建模 (https://huggingface.co/papers?q=process%20reward%20modeling) 和策略内蒸馏 (https://huggingface.co/papers?q=on-policy%20distillation),引入了额外的约束,例如依赖专门的奖励模型或假设教师与学生之间存在相同的推理模式。然而,我们观察到,一旦推理过程首次出错,评估后续推理所提供的额外信息有限,因为它已经基于无效的前缀。因此,我们提出了 Cliff,一种奖励塑造 (https://huggingface.co/papers?q=reward%20shaping) 策略,它利用现成的 LLM 作为教师来识别每个生成序列中的第一个错误。结果,该生成序列自然地被分解为两部分:一个正确的前缀和一个错误的后缀。Cliff 然后将此信号转换为词元级优势 (https://huggingface.co/papers?q=token-level%20advantages),为正确的前缀分配正优势,而为之后的部分分配负反馈。在 12 种不同场景下的实验表明,Cliff 持续提升了推理性能,即使使用能力一般的教师模型,其表现也优于策略内蒸馏 (https://huggingface.co/papers?q=on-policy%20distillation) 15%,优于标准的 GRPO (https://huggingface.co/papers?q=GRPO) 7%。此外,我们分析了“ground truth”在 Cliff 中的作用,并研究了其训练动态。这些结果表明,Cliff 是一种简单、通用且有效的方法,能通过更丰富、细粒度的监督来改进 RLVR。

查看 arXiv 页面 (https://arxiv.org/abs/2609.02817) 查看 PDF (https://arxiv.org/pdf/2609.02817) 项目页面 (https://x.com/peixuanhakhan/status/2095334137909359011) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.02817)

在您的 agent 中获取此论文:

hf papers read 2609\.02817

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.02817 以从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.02817 以从此页面链接。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.02817 以从此页面链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。