AVE-Compass:迈向音视频编辑能力的全面评估

Hugging Face Daily Papers 论文

摘要

AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。

尽管基于指令的视频编辑发展迅速,但现实世界中的视频包含紧密耦合的音频和视觉信号,编辑一种模态通常需要协调修改另一种模态。现有基准主要评估静音片段上的视觉变换或孤立的音频编辑,导致复杂的音视频编辑和跨模态一致性未得到充分探索。我们引入了 AVE-Compass,一个全面的基准,包含 145 个精选源视频、196 条音视频耦合编辑指令和 2,688 个细粒度检查表项。它通过基于检查表的 MLLM 评估和专门的逼真度评分标准来评估指令遵循 (Instruction Following)、保真度保持 (Fidelity Preserving)、真实性 (Realism) 和编辑意图 (Editing Intent),并辅以自动化的跨模态、视频和音频指标。大量评估表明,最先进的模型在执行跨模态指令同时保持非目标内容方面仍然存在困难。我们进一步提出了 AVE-Agent,一个模块化智能体框架,它将复杂指令分解为相互依赖的子任务,并通过自我反思和评估器反馈迭代改进编辑结果。AVE-Agent 在联合编辑中提高了指令执行、保真度保持和音视频对齐,同时保持了有竞争力的感知质量。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:49

论文页面 - AVE-Compass:迈向音视频编辑能力的全面评估

来源:https://huggingface.co/papers/2607.24821

摘要

尽管基于指令的视频编辑技术发展迅速,但现实世界中的视频包含紧密耦合的音频和视觉信号,编辑一种模态往往需要另一种模态的协调变化。现有基准主要评估无声片段上的视觉变换或孤立的音频编辑,导致复杂的音视频联合编辑和跨模态一致性仍未得到充分探索。我们引入AVE-Compass,一个全面的基准,包含145个精选源视频、196条音视频耦合的编辑指令和2,688个细粒度检查项。它通过基于检查项的MLLM评判和专用真实性评估标准来评估指令遵循、保真度保持、真实感和编辑意图,并辅以自动化的跨模态、视频和音频指标。大量评估表明,最先进的模型在跨模态指令执行和非目标内容保持方面仍存在困难。我们进一步提出AVE-Agent,一个模块化智能体框架,将复杂指令分解为相关的子任务,并通过自我反思和评估器反馈迭代改进编辑结果。AVE-Agent在联合编辑中提升了指令执行、保真度保持和音视频对齐,同时保持了有竞争力的感知质量。

查看 arXiv 页面 (https://arxiv.org/abs/2607.24821)查看 PDF (https://arxiv.org/pdf/2607.24821)项目页面 (https://ave-compass.github.io/)GitHub (https://github.com/NJU-LINK/AVE-Compass)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24821)

在您的智能体中获取此论文:

hf papers read 2607\.24821

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.24821 以从此页面链接。

引用此论文的数据集1

NJU-LINK/AVE-Compass-v2 查看器• 更新于8天前 • 196 • 925 • 2 (https://huggingface.co/datasets/NJU-LINK/AVE-Compass-v2)

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.24821 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

CoVEBench:视频编辑模型能否处理复杂指令?

Hugging Face Daily Papers

引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。