CoVEBench:视频编辑模型能否处理复杂指令?
摘要
引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。
查看缓存全文
缓存时间: 2026/06/09 08:43
论文页 - CoVEBench: 视频编辑模型能处理复杂指令吗?
来源: https://huggingface.co/papers/2606.08415
摘要
本文提出了一个新基准 CoVEBench,用于评估组合式视频编辑能力,旨在解决现有模型在处理复杂、多步骤编辑任务时无法在保留时空内容的前提下完成多个编辑操作的问题。
虽然近期文本引导视频编辑(https://huggingface.co/papers?q=text-guided%20video%20editing)模型在基础任务(如风格迁移、物体插入)上表现出色,但真实用户请求往往是高度组合式的。单个提示词常常要求多个耦合编辑,例如同时修改主体、动作和摄像机视角,同时严格保留不相关的时空内容。现有基准受限于孤立编辑和粗略的全局指标,无法诊断模型如何处理此类复杂工作流程。为填补这一空白,我们引入了 CoVEBench——一个组合式视频编辑基准(https://huggingface.co/papers?q=video%20editing%20benchmark),包含 416 个精心挑选的源视频、626 条多点编辑指令(https://huggingface.co/papers?q=multi-point%20editing%20instructions)以及 9,990 个细粒度检查项。覆盖多种编辑维度,CoVEBench 通过 MLLM 评判的指令遵循度(https://huggingface.co/papers?q=instruction%20compliance)和视频保真度(https://huggingface.co/papers?q=video%20fidelity),以及自动指标(https://huggingface.co/papers?q=automated%20metrics)来评估视频质量。大量实验表明,组合式编辑(https://huggingface.co/papers?q=compositional%20editing)仍然是一个重大挑战:当前模型在同时处理多个操作时常常遗漏编辑、违反保留约束或引入伪影。CoVEBench 提供了一个具有挑战性的诊断测试平台,推动视频编辑向真实用户工作流程迈进。
查看 arXiv 页面(https://arxiv.org/abs/2606.08415)查看 PDF(https://arxiv.org/pdf/2606.08415)项目页面(https://nju-link.github.io/CoVEBench/)GitHub7(https://github.com/NJU-LINK/CoVEBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.08415)
在您的代理中获取此论文:
hf papers read 2606\.08415
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.08415 即可从此页面链接。
引用此论文的数据集1
NJU-LINK/CoVEBench 查看器 • 更新于约6小时前 • 626 • 470 • 1(https://huggingface.co/datasets/NJU-LINK/CoVEBench)
引用此论文的Spaces0
暂无Space链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.08415 即可从此页面链接。
包含此论文的收藏集2
相似文章
VCIFBench:评估视频理解中的复杂指令遵循能力
VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。
VEFX-Bench:通用视频编辑与视觉特效的全方位基准
VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。
CoinVE-200K: 用于组合式指令引导视频编辑的大规模高质量数据集
本文介绍了CoinVE-200K,一个用于组合式指令引导视频编辑的大规模数据集,以及一个基准测试和一个22B模型,该模型可实现具有时序一致性的精确多区域编辑。
AVE-Compass:迈向音视频编辑能力的全面评估
AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。