VlogReward:学习面向Vlog编辑的多维度评估
摘要
介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。
arXiv:2607.22632v1 Announce Type: new
摘要:Vlog作为一种个性化叙事媒介的迅速崛起,催生了对自动化评估和优化Vlog编辑计划的需求。然而,Vlog评估高度主观,且由于缺乏标准化标准、数据集和基准测试以及有效的奖励模型,仍然具有挑战性。为应对这些挑战,我们定义了一个全面的Vlog评估框架,该框架由专业Vlog创作者和产品经理指导,建立了六个关键维度的分类体系:创意性、一致性、概念设计、摄影、叙事和节奏。随后,我们整理了一个包含10万条Vlog编辑的大规模数据集和一个专用基准测试VRMBench,用以评估多模态大语言模型(MLLMs)的Vlog奖励能力。最后,我们提出了VlogReward,一个稳健的Vlog奖励模型,能够提供细粒度的多维度分数和可操作的反馈以进行迭代优化。在技术上,我们通过引入可调节的组间比较奖励来增强组相对策略优化(Group Relative Policy Optimization, GRPO)框架,这缓解了标准GRPO的“方向盲视”问题,使模型能够更好地区分不同质量的编辑。VlogReward取得了最先进的结果,显著优于现有MLLMs,包括GPT-5和Gemini-3-Pro。我们希望这项研究能帮助Vlog创作者,并推动自动化Vlog评估和优化系统的发展。
查看缓存全文
缓存时间: 2026/07/28 06:26
# VlogReward:为Vlog剪辑学习多维度评估 来源:https://arxiv.org/html/2607.22632 温众Sijie ZhuXin GuFan ChenJunxian DuanJie CaoLongyin WenZhenfang Chen ###### 摘要 随着Vlog作为一种个性化叙事媒介的迅速崛起,产生了对自动化系统来评估和改进Vlog剪辑方案的需求。然而,Vlog评估高度主观,且由于缺乏标准化标准、数据集和基准以及有效的奖励模型,仍然具有挑战性。为应对这些挑战,我们根据专业Vlog创作者和产品经理的指导,定义了一个全面的Vlog评估框架,建立了六个关键维度的分类体系,即**创造性**、**一致性**、**概念设计**、**摄影技巧**、**叙事**和**节奏**。随后,我们整理了一个包含10万条Vlog剪辑的大规模数据集和一个专用基准VRMBench,用于评估多模态大语言模型(MLLMs)的Vlog奖励能力。最后,我们提出了VlogReward,一个强大的Vlog奖励模型,能够提供细粒度的多维度分数和可操作的反馈,用于迭代优化。技术上,我们通过引入可调的组间比较奖励来增强组相对策略优化(GRPO)框架,这缓解了标准GRPO的“方向盲区”问题,并使模型更好地区分不同质量的编辑。VlogReward取得了最先进的结果,显著优于包括GPT-5和Gemini-3-Pro在内的现有MLLMs。我们希望我们的研究能够帮助Vlog创作者,并推动自动化Vlog评估和优化系统的发展。 机器学习,ICML 参见图例 Figure 1:与通常简单且分离的常规视频理解任务不同,Vlog剪辑涉及更复杂且交织的过程。为了对Vlog剪辑的每一步和每个元素进行全面评估,评估标准需要是多层次且高度主观的,这给Vlog奖励建模带来了独特的挑战。 ## 1 引言 如今,个人媒体创作的迅速普及使得视频博客(即vlog)成为在线叙事的主导且高度个性化的媒介(Ladhari et al., 2020; Duan et al., 2025)。与此同时,多模态大语言模型(MLLMs)的综合能力显著发展(Zhang et al., 2025a; Hong et al., 2025; Comanici et al., 2025),为复杂的视频-语言任务提供了新的可能性。这种协同作用提出了一个新的问题:**我们能否利用MLLMs先进的多模态推理能力来评估Vlog草稿,并提炼出高质量的编辑方案?** 这项研究将有助于Vlog创作者改进他们的作品,同时为自动化Vlog编辑优化系统铺平道路,以促进商业制作。 与传统视频理解任务通常处理单一、连续且结构良好的视频不同(Tang et al., 2025; Madan et al., 2024),Vlog剪辑更为复杂,如图1所示。它从大量原始、未组织且经常冗余的用户提供的视频素材开始。为了将这些离散的片段转化为引人注目的Vlog,创作者必须导航一个复杂的决策空间:设计故事情节和叙事风格,从杂乱的素材中选择最有表现力的片段,精确裁剪时间戳,确定序列顺序,编写脚本,以及编排多模态编辑元素,如字幕、画外音、过渡、音乐、表情符号、字体样式、特效等。因此,评估Vlog的质量本质上是多层次且更加主观的,呈现出超越标准图像/视频评估(Xu et al., 2023; Fu et al., 2025)的独特挑战。除了字幕与视觉对应以及镜头顺序逻辑等客观因素外,蒙太奇Vlog的精髓在于高度主观的维度:主题的概念设计、整体叙事的创造性、镜头选择的摄影美学、故事情节的节奏等。这些因素难以量化,但对于区分不同质量的Vlog编辑至关重要。因此,尽管基于MLLM的评估潜力巨大(Wang et al., 2025a, e; Wu et al., 2025),自动评估Vlog编辑仍然是一项艰巨的任务。 首先,**缺乏标准化的Vlog评估标准作为参考**。其次,该领域**严重缺乏专用的基准和带注释的Vlog数据**。最后,这些因素共同导致了**缺乏用于此类Vlog奖励建模的有效模型**。为了系统性地克服这些挑战,我们**首先**与专业Vlog设计师和艺术专家合作,整合评估指标,定义了六个关键维度的标准化分类体系,建立了一个多维度和细粒度的评估框架。**其次**,我们整理了一个包含10万条Vlog剪辑的大规模训练数据集,以及一个专用基准,用于评估MLLMs的Vlog奖励能力。**最后**,我们开发了一个强大的Vlog奖励模型(VRM),能够为任何给定的原始素材和相应的编辑方案提供多维度的分数和反馈。遵循奖励建模的最新进展(Guo et al., 2025b; Wang et al., 2025d),我们首先进行监督微调(SFT),然后利用强化学习(RL)进一步增强我们的VRM的Vlog奖励能力。然而,原始的组相对策略优化(GRPO)(Shao et al., 2024)本质上设计为计算组内相对优势,因此缺乏针对不同编辑的跨样本参考信号。我们观察到这会导致“方向盲区”问题,并引入了**组间比较奖励**。通过涉及比较组间采样输出的奖励信号,它使模型能够更好地区分不同质量的Vlog编辑,并更有效地识别最优编辑方案。 我们的贡献可总结如下: - •**新颖的任务制定和系统评估框架**。我们提出了自动Vlog编辑评估的新任务,并与专业Vlog设计师和产品经理合作,建立了涵盖六个关键维度的全面分类体系。 - •**大规模数据集和基准构建**。我们整理了一个包含10万条Vlog剪辑的高质量训练数据集,并引入了**VRMBench**,一个专用基准,包括主观美学评估案例和客观事实错误案例。VRMBench包含400个独特组,每组包含一组原始视频素材和四个质量递减的不同编辑方案,并配有分数和文本反馈。这涉及两阶段耗时数据收集,经过**3.6千人时**验证。 - •**多维度Vlog奖励模型**。我们开发了**VlogReward**,能够通过多维度分数和反馈来区分不同质量的Vlog编辑。通过我们的组间比较奖励设计,VlogReward在比较准确率(69.4% → 73.5%)、最佳N选择准确率(65.0% → 67.6%)和分数准确率(50.3% → 51.3%)上取得了显著提升。此外,调整比较奖励的强度可以在评分和区分能力之间实现灵活的权衡。 参见图例 Figure 2:数据收集流程。主观数据集:我们首先收集原始素材v,并使用MLLMs合成多样化的编辑方案 (x1, x2, ..., xm),这些方案在主观领域(如美学和创造性)上有所不同。然后我们对它们进行奖励以获得多维度分数s和反馈f。整个过程涉及人工验证,以检查幻觉,确保分数和反馈之间的一致性,并过滤掉低质量数据。客观数据集:我们另外收集了8000个素材,并使用相同的流程注释编辑方案。随后,我们逐步引入篡改,如更改剪切时间戳或字幕,以创建客观事实错误,从而为每个素材生成四个质量递减的方案。主观和客观数据集分别划分。然后合并得到最终的训练数据集和VRMBench基准。 ## 2 相关工作 Vlog编辑与评估。由于Vlog编辑的复杂性,各种研究主要关注其分解子任务,如精彩片段检测(Gan et al., 2023)、镜头逻辑排序(Pardo et al., 2024)、视频内容摘要(Xie et al., 2022)和下一镜头预测(Hu et al., 2023)。随着MLLMs的快速发展,最近一些研究开始探索基于Agent的端到端框架,以一次性自动化整个编辑流程(Yang et al., 2024; Sandoval-Castaneda et al., 2025; Pardo et al., 2024; Wang et al., 2025c)。然而,现有工作广泛使用IoU型重叠指标或采用定制化的、劳动密集型的人工评分来评估Vlog编辑,这限制了可重复性和推广。此外,Vlog编辑本质上是一个创造性和灵活的过程,剪切时间戳不应有绝对的标注真实值。这需要一个标准化、全面和通用的评估框架,以及相应的Vlog奖励模型来促进自动评估。 多模态奖励建模。多模态奖励建模在使MLLMs与人类偏好对齐方面起着关键作用(Zhang et al., 2025e; Sun et al., 2024; Zhang et al., 2025d; Duan et al., 2026)。早期方法使用微调后的CLIP模型来生成偏好分数(Kirstain et al., 2023; Wu et al., 2023)。后续工作为模型的骨干网络附加一个线性回归头,以输出标量奖励值(Liu et al., 2025a; Zang et al., 2025)。随着MLLMs的快速发展,生成式奖励建模(GRM)代表了从标量回归奖励模型(RRM)的范式转变,实现了更灵活和可解释的输出。最近,一些GRM研究尝试应用一些推理策略,如测试时缩放和强化学习方法(Liu et al., 2025b; Zhang et al., 2026; Liu et al., 2025c),以进一步增强奖励能力(Chen et al., 2025; Xue et al., 2025)。然而,大多数现有的多模态奖励建模框架直接使用成对比较范式来识别相对偏好(Zhang et al., 2025c, f)。虽然成对排序可以有效捕捉比较信号,但它缺乏细粒度的多维度评分和直接的可诊断反馈能力。因此,我们提出了一个超越二元偏好的GRM框架,提供六个不同维度的全面分数和反馈,同时反映相对偏好。 GRPO变体。已经出现了几种GRPO变体来解决其稳定性和可扩展性挑战。GSPO(Zheng et al., 2025)转向序列级优化以稳定混合专家模型,DAPO(Yu et al., 2025)引入了用于大规模强化学习的解耦裁剪。BNPO(Xiao et al., 2025)引入了使用动态Beta分布的自适应奖励归一化。GMPO(Zhao et al., 2025)用几何均值代替算术均值以抑制令牌级异常值。对于去中心化环境,GEPO(Zhang et al., 2025b)利用组期望加权来减轻网络延迟引起的高KL散度。与我们的组间奖励思想类似,一些工作利用组间采样输出来计算优势。例如,DyKnow-RAG(Xu et al., 2025)将GRPO集成到检索增强生成中,并带有组间优势。GRPOformer(Guo et al., 2025a)采用组间相对优势,使GRPO适应高效的超参数优化。 参见图例 Figure 3:数据示例。为方便多模态处理,原始视频素材 {v1, v2, ..., vn} 被拼接成一个单独的视频 v,每个片段之间用3秒黑屏隔开。编辑方案x是一个JSON,封装了剪切时间戳、播放速度、画外音、镜头顺序、标题和字幕。我们将可编辑变量限制在这些核心结构属性上,以适应MLLMs的帧采样机制并最小化干扰。风格元素如音色、过渡、视觉效果和自定义排版(例如字体颜色、大小和样式)被标准化。在此方案中,“shot_timestamp”和“final_timestamp”分别对应拼接视频v和最终编辑Vlog中的时间范围。两者之间的持续时间不匹配会触发播放速度调整。附带的反馈提供评分理由,并明确指出显著问题和改进建议。 ## 3 方法 ### 3.1 任务设计 专注于蒙太奇Vlog,我们的核心目标是开发一个稳健的VRM来评估编辑方案的质量。给定一组原始视频素材 v = {v1, v2, ..., vn},VRM M 应提供对任何候选编辑方案 x 的全面评估。与用于更简单任务的标量奖励模型不同,我们的VRM被设计为多维度生成式奖励模型。对于给定对 (v, x),模型生成一组数值分数 s = {s1, s2, ..., sk},代表k个不同的质量维度,以及可解释的文本反馈序列 f = {f1, f2, ..., fk}。反馈f作为诊断性评论,明确识别事实问题并在编辑方案中提供优化指导。相似文章
RewardVerse:评分标准指导的策略优化用于视频奖励建模
RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。
一致性多参考图像编辑的评估-验证奖励
本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
VEFX-Bench:通用视频编辑与视觉特效的全方位基准
VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。
WorldReward: 针对相机条件化世界模型的奖励建模
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。