CoVEBench:视频编辑模型能否处理复杂指令?

Hugging Face Daily Papers 论文

摘要

引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。

尽管最近的文本引导视频编辑模型在基础任务(如风格迁移、物体插入)上表现出色,但真实用户请求通常具有高度组合性。单个提示词往往需要多个耦合编辑,例如同时修改主体、动作和摄像机视角,同时严格保留不相关的时空内容。现有基准受限于孤立编辑和粗粒度的全局指标,无法诊断模型如何处理此类复杂工作流程。为填补这一空白,我们引入了CoVEBench,这是一个组合视频编辑基准,包含416个精心策划的源视频、626个多点编辑指令和9,990个细粒度检查项。CoVEBench覆盖多种编辑维度,通过MLLM评判的指令合规性和视频保真度,以及视频质量的自动化指标来评估模型。大量实验表明,组合编辑仍是一个深刻挑战:当前模型在处理多个操作时,经常遗漏编辑、违反保持约束或引入伪影。CoVEBench为推进视频编辑向真实用户工作流程发展,提供了一个具有挑战性的诊断测试平台。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:43

论文页 - CoVEBench: 视频编辑模型能处理复杂指令吗?

来源: https://huggingface.co/papers/2606.08415

摘要

本文提出了一个新基准 CoVEBench,用于评估组合式视频编辑能力,旨在解决现有模型在处理复杂、多步骤编辑任务时无法在保留时空内容的前提下完成多个编辑操作的问题。

虽然近期文本引导视频编辑(https://huggingface.co/papers?q=text-guided%20video%20editing)模型在基础任务(如风格迁移、物体插入)上表现出色,但真实用户请求往往是高度组合式的。单个提示词常常要求多个耦合编辑,例如同时修改主体、动作和摄像机视角,同时严格保留不相关的时空内容。现有基准受限于孤立编辑和粗略的全局指标,无法诊断模型如何处理此类复杂工作流程。为填补这一空白,我们引入了 CoVEBench——一个组合式视频编辑基准(https://huggingface.co/papers?q=video%20editing%20benchmark),包含 416 个精心挑选的源视频、626 条多点编辑指令(https://huggingface.co/papers?q=multi-point%20editing%20instructions)以及 9,990 个细粒度检查项。覆盖多种编辑维度,CoVEBench 通过 MLLM 评判的指令遵循度(https://huggingface.co/papers?q=instruction%20compliance)和视频保真度(https://huggingface.co/papers?q=video%20fidelity),以及自动指标(https://huggingface.co/papers?q=automated%20metrics)来评估视频质量。大量实验表明,组合式编辑(https://huggingface.co/papers?q=compositional%20editing)仍然是一个重大挑战:当前模型在同时处理多个操作时常常遗漏编辑、违反保留约束或引入伪影。CoVEBench 提供了一个具有挑战性的诊断测试平台,推动视频编辑向真实用户工作流程迈进。

查看 arXiv 页面(https://arxiv.org/abs/2606.08415)查看 PDF(https://arxiv.org/pdf/2606.08415)项目页面(https://nju-link.github.io/CoVEBench/)GitHub7(https://github.com/NJU-LINK/CoVEBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.08415)

在您的代理中获取此论文:

hf papers read 2606\.08415

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2606.08415 即可从此页面链接。

引用此论文的数据集1

NJU-LINK/CoVEBench 查看器 • 更新于约6小时前 • 626 • 470 • 1(https://huggingface.co/datasets/NJU-LINK/CoVEBench)

引用此论文的Spaces0

暂无Space链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.08415 即可从此页面链接。

包含此论文的收藏集2

相似文章

VCIFBench:评估视频理解中的复杂指令遵循能力

arXiv cs.CL

VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。

AVE-Compass:迈向音视频编辑能力的全面评估

Hugging Face Daily Papers

AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。