RewardVerse:评分标准指导的策略优化用于视频奖励建模

Hugging Face Daily Papers 论文

摘要

RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。

强化学习(RL)对于优化视频生成模型至关重要,一个稳健的奖励模型(RM)是其基石。然而,现有的视频奖励模型常常产生不稳定的标量分数,因为它们在没有明确评估标准的情况下,直接将复杂、主观的视频质量映射为单一分数。这导致了标量漂移,即评分尺度在不同提示下崩溃或偏移,使奖励对RL不可靠。借鉴专业的人类标注工程,我们使用RewardVerse来解决这个问题,这是一个基于评分标准的视频奖励框架,引入了动态评分标准作为评估查询和评分器之间的中间表示。RewardVerse 不进行无约束的直接评分,而是首先生成明确的评估标准,然后执行评分标准指导的评分,提供稳定的语义锚点以缓解标量漂移。为了高效优化这一协作流程,我们提出了评分标准指导的策略优化(RGPO),一种两阶段训练算法。RGPO 首先使用自进化的种子评分标准预热评分器,然后联合优化评分标准生成器以产生查询自适应的评估标准,同时持续将评分器与人类评级对齐。在16维EvalVerse基准和外部数据集上的广泛实验表明,RewardVerse缓解了标量漂移,在逐点和成对评估上都取得了最先进的性能,并为视频生成中的RL提供了稳健且可解释的奖励信号。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:37

论文页面 - RewardVerse:面向视频奖励建模的规则引导策略优化

来源:https://huggingface.co/papers/2609.22947

摘要

强化学习在优化视频生成模型中至关重要,而一个稳健的奖励模型则是其基石。然而,现有的视频奖励模型常常产生不稳定的标量分数,因为它们直接将复杂、主观的视频质量映射为单一分数,缺乏明确的评估标准。这导致了标量漂移问题,即评分量级在不同提示间发生坍缩或偏移,使得奖励信号对于强化学习而言不可靠。受到专业人类标注工程的启发,我们提出了 RewardVerse 来解决此问题。这是一个基于规则的视频奖励框架,引入了动态规则作为评估查询与评分器之间的中间表示。RewardVerse 并非进行无约束的直接评分,而是首先生成明确的评估标准,然后执行基于规则的评分,提供了一个稳定的语义锚点,从而缓解了标量漂移。为了高效地优化这一协作流程,我们提出了规则引导策略优化,这是一种两阶段训练算法。RGPO 首先使用自演化的种子规则对评分器进行预热,然后联合优化规则生成器以产生查询自适应的评估标准,同时持续地将评分器与人类评分进行对齐。在 16 维 EvalVerse 基准和外部数据集上的大量实验表明,RewardVerse 能够缓解标量漂移,在逐点和成对评估任务上均达到最先进性能,并为视频生成中的强化学习提供了一个稳健且可解释的奖励信号。

查看 arXiv 页面 (https://arxiv.org/abs/2609.22947) 查看 PDF (https://arxiv.org/pdf/2609.22947) 项目主页 (https://2kxx.github.io/RewardVerse/) GitHub3 (https://github.com/2kxx/RewardVerse) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.22947)

通过您的代理获取本文:

hf papers read 2609\.22947

没有最新的 CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接本文

在模型的 README.md 中引用 arxiv\.org/abs/2609.22947 以从此页面链接它。

引用本文的数据集0

没有数据集链接本文

在数据集的 README.md 中引用 arxiv\.org/abs/2609.22947 以从此页面链接它。

引用本文的 Space0

没有 Space 链接本文

在 Space 的 README.md 中引用 arxiv\.org/abs/2609.22947 以从此页面链接它。

包含本文的收藏0

没有收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。

C2:基于二元偏好的可扩展评分增强奖励建模

Hugging Face Daily Papers

C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。