RLHF的另一面:基于策略内反馈的奖励模型自监督改进

Hugging Face Daily Papers 论文

摘要

SAVE框架通过使用价值函数对策略内响应进行评分,并通过对比目标更新模型,从而改善奖励模型训练,在六个基准测试中取得了优于其他方法的结果。

构建强大的语言模型对齐奖励模型(RM)的瓶颈在于从人工标注或裁判模型获取多样且可靠的偏好数据的成本和难度。随着策略超出静态RM训练的范围,这一问题变得尤为严重。因此,我们提出了SAVE(基于价值锚定策略内反馈的自监督奖励模型改进)框架,该框架通过使用价值函数对策略内响应进行评分,并将其作为反馈用于策略内RM训练。SAVE自然地通过将奖励评分的策略内响应转换为监督信号,并利用提示特定的价值头作为自适应锚点。它计算RM优势值并过滤模糊样本,通过对比目标更新RM。通过在六个不同基准上的严格实证评估,SAVE在增强RM训练方面的有效性得到了有力验证。它在所有数据集上取得了优于其他方法的结果,同时在三种RL算法(GRPO、RLOO、GSPO)和不同策略骨干上保持了一致的改进。
查看原文
查看缓存全文

缓存时间: 2026/06/01 07:18

论文页面 - RLHF的另一面:面向奖励模型自监督改进的在策略反馈

来源:https://huggingface.co/papers/2605.30888

摘要

SAVE 框架通过使用价值函数对在策略响应进行评分,并借助对比目标更新模型,从而改进奖励模型的训练过程。

构建用于语言模型对齐的强奖励模型(RMs)一直受到获取多样、可靠偏好数据(来自人工标注或评判模型)的成本和难度的制约。随着策略的演进超越静态 RM 训练,这一问题变得愈发严峻。为此,我们提出了 SAVE(通过价值锚定的在策略反馈实现奖励模型自监督改进)框架,该框架利用价值函数对在策略响应进行评分,并将其作为反馈用于在策略 RM 训练。SAVE 自然地将奖励评分的在策略响应转化为监督信号,采用一个与提示相关的价值头作为自适应锚点。它计算 RM 优势值,并过滤模糊样本,通过对比目标更新 RM。通过在六个不同基准上的严格实证评估,SAVE 在增强 RM 训练方面的有效性得到了有力验证。它在所有数据集上均取得了优异结果,并且在三种 RL 算法(GRPO、RLOO、GSPO)以及不同的策略骨干网络上保持一致的改进。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30888) 查看 PDF (https://arxiv.org/pdf/2605.30888) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30888)

在您的 agent 中获取此论文:

hf papers read 2605.30888

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.30888,以在此页面建立链接。

引用此论文的数据集0

无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.30888,以在此页面建立链接。

引用此论文的 Space0

无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.30888,以在此页面建立链接。

收录此论文的集合0

无集合收录此论文

请将本论文添加到一个集合 (https://huggingface.co/new-collection) 中,以在此页面建立链接。

相似文章

奖励模型可能过于敏感(22分钟阅读)

TLDR AI

本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。

同策略优化中验证器诱导的支持重塑

arXiv cs.LG

本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。