先思考,再打分:解耦推理与打分的视频奖励建模
摘要
本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。
查看缓存全文
缓存时间: 2026/05/08 07:21
论文页面 - 先思考,再打分:视频奖励建模中的解耦推理与评分
来源:https://huggingface.co/papers/2605.05922 作者:
,
,
,
,
,
,
,
,
,
摘要
视频奖励模型在平衡判别精度与生成式推理方面面临挑战;一种新方法将思考与评分过程解耦,以提高训练效率和泛化能力。
生成式视频模型的最新进展越来越多地由后训练和测试时缩放(test-time scaling)驱动,这两者都严重依赖于视频奖励模型(Reward Models, RMs)的质量。一个理想的奖励模型应在各种场景下预测与人类偏好一致的高质量奖励。然而,现有范式面临一个根本性困境:判别式奖励模型直接从多模态大语言模型(MLLMs)提取的特征上回归奖励值,缺乏显式的推理过程,这使其容易产生捷径学习(shortcut learning),并严重依赖大规模数据缩放来实现泛化。相比之下,采用思维链(Chain-of-Thought, CoT)推理的生成式奖励模型展现出更优的可解释性和泛化潜力,因为它们利用细粒度的语义监督来内化人类偏好背后的逻辑。然而,由于推理和评分被耦合在单一的自回归推理链中,它们存在固有的优化瓶颈。为了利用 CoT 推理带来的泛化优势,同时缓解耦合推理与评分导致的训练不稳定性,我们引入了 DeScore,这是一种训练高效且具备良好泛化能力的视频奖励模型。DeScore 采用了一种解耦的“先思考,再打分”范式:首先由 MLLM 生成显式的思维链,随后由一个专门的判别式评分模块进行打分,该模块由一个可学习的查询令牌(learnable query token)和一个回归头(regression head)组成,用于预测最终奖励。DeScore 通过一个两阶段框架进行优化:(1) 一个结合随机掩码机制(random mask mechanism)的判别式冷启动阶段,以确保稳健的评分能力;(2) 一个双目标强化学习(dual-objective reinforcement learning)阶段,该阶段独立地优化 CoT 推理质量并校准最终奖励,确保更高质量的推理直接转化为更优越的模型性能。
查看 arXiv 页面 (https://arxiv.org/abs/2605.05922) 查看 PDF (https://arxiv.org/pdf/2605.05922) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.05922)
在你的代理中获取这篇论文:
hf papers read 2605\.05922
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有链接到该论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2605.05922 即可从此页面链接它。
引用此论文的数据集 0
没有链接到该论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.05922 即可从此页面链接它。
引用此论文的 Spaces 0
没有链接到该论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.05922 即可从此页面链接它。
包含此论文的收藏集 0
没有包含该论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接它。
相似文章
先思考,再评分:视觉生成的思考奖励模型
本文介绍了思考奖励模型(TRM),该模型显式地制定案例自适应标准来评估视觉生成,在开源奖励模型中实现了最先进的性能。
高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型
本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。
RewardVerse:评分标准指导的策略优化用于视频奖励建模
RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。
ThinkV2V:释放多模态大语言模型在指令引导视频编辑中的推理能力
ThinkV2V 提出一个推理驱动的框架,在视觉生成之前激活 MLLM 的思考过程,用于指令引导的视频编辑。该框架采用 MLLM-to-DiT 架构,结合渐进式课程训练与推理时思维扩展技术。作者还发布了 ThinkV2V-150K 数据集和 ThinkV2V-Bench,实验表明其 5B 规模的 DiT 模型性能超越了更大的 10B 基线模型。
ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理
ProcessThinker 引入了一种实用的后训练流程,无需训练显式的过程奖励模型即可提供步骤级的过程奖励。它利用基于展开的奖励为多模态大语言模型中的多步推理提供密集的信用分配,在视频基准测试上持续提升性能。