RewardVerse:评分标准指导的策略优化用于视频奖励建模
摘要
RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。
查看缓存全文
缓存时间: 2026/09/24 03:37
论文页面 - RewardVerse:面向视频奖励建模的规则引导策略优化
来源:https://huggingface.co/papers/2609.22947
摘要
强化学习在优化视频生成模型中至关重要,而一个稳健的奖励模型则是其基石。然而,现有的视频奖励模型常常产生不稳定的标量分数,因为它们直接将复杂、主观的视频质量映射为单一分数,缺乏明确的评估标准。这导致了标量漂移问题,即评分量级在不同提示间发生坍缩或偏移,使得奖励信号对于强化学习而言不可靠。受到专业人类标注工程的启发,我们提出了 RewardVerse 来解决此问题。这是一个基于规则的视频奖励框架,引入了动态规则作为评估查询与评分器之间的中间表示。RewardVerse 并非进行无约束的直接评分,而是首先生成明确的评估标准,然后执行基于规则的评分,提供了一个稳定的语义锚点,从而缓解了标量漂移。为了高效地优化这一协作流程,我们提出了规则引导策略优化,这是一种两阶段训练算法。RGPO 首先使用自演化的种子规则对评分器进行预热,然后联合优化规则生成器以产生查询自适应的评估标准,同时持续地将评分器与人类评分进行对齐。在 16 维 EvalVerse 基准和外部数据集上的大量实验表明,RewardVerse 能够缓解标量漂移,在逐点和成对评估任务上均达到最先进性能,并为视频生成中的强化学习提供了一个稳健且可解释的奖励信号。
查看 arXiv 页面 (https://arxiv.org/abs/2609.22947) 查看 PDF (https://arxiv.org/pdf/2609.22947) 项目主页 (https://2kxx.github.io/RewardVerse/) GitHub3 (https://github.com/2kxx/RewardVerse) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.22947)
通过您的代理获取本文:
hf papers read 2609\.22947
没有最新的 CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
在模型的 README.md 中引用 arxiv\.org/abs/2609.22947 以从此页面链接它。
引用本文的数据集0
没有数据集链接本文
在数据集的 README.md 中引用 arxiv\.org/abs/2609.22947 以从此页面链接它。
引用本文的 Space0
没有 Space 链接本文
在 Space 的 README.md 中引用 arxiv\.org/abs/2609.22947 以从此页面链接它。
包含本文的收藏0
没有收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
并非每种评分标准都同样有效:面向策略感知的评分标准奖励用于RLVR
本文提出POW3R,一种面向策略感知的评分标准奖励框架,用于可验证奖励的强化学习(RLVR)。它表明静态评分标准聚合会错误分配学习信号,而POW3R在多种设置下实现了更快的收敛和更好的性能。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
C2:基于二元偏好的可扩展评分增强奖励建模
C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。
SERPO:面向开放式测试时强化学习的自演化评分策略优化
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。