AVE-Compass:迈向音视频编辑能力的全面评估
摘要
AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。
查看缓存全文
缓存时间: 2026/08/06 05:49
论文页面 - AVE-Compass:迈向音视频编辑能力的全面评估
来源:https://huggingface.co/papers/2607.24821
摘要
尽管基于指令的视频编辑技术发展迅速,但现实世界中的视频包含紧密耦合的音频和视觉信号,编辑一种模态往往需要另一种模态的协调变化。现有基准主要评估无声片段上的视觉变换或孤立的音频编辑,导致复杂的音视频联合编辑和跨模态一致性仍未得到充分探索。我们引入AVE-Compass,一个全面的基准,包含145个精选源视频、196条音视频耦合的编辑指令和2,688个细粒度检查项。它通过基于检查项的MLLM评判和专用真实性评估标准来评估指令遵循、保真度保持、真实感和编辑意图,并辅以自动化的跨模态、视频和音频指标。大量评估表明,最先进的模型在跨模态指令执行和非目标内容保持方面仍存在困难。我们进一步提出AVE-Agent,一个模块化智能体框架,将复杂指令分解为相关的子任务,并通过自我反思和评估器反馈迭代改进编辑结果。AVE-Agent在联合编辑中提升了指令执行、保真度保持和音视频对齐,同时保持了有竞争力的感知质量。
查看 arXiv 页面 (https://arxiv.org/abs/2607.24821)查看 PDF (https://arxiv.org/pdf/2607.24821)项目页面 (https://ave-compass.github.io/)GitHub (https://github.com/NJU-LINK/AVE-Compass)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24821)
在您的智能体中获取此论文:
hf papers read 2607\.24821
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.24821 以从此页面链接。
引用此论文的数据集1
NJU-LINK/AVE-Compass-v2 查看器• 更新于8天前 • 196 • 925 • 2 (https://huggingface.co/datasets/NJU-LINK/AVE-Compass-v2)
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.24821 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估
LongAV-Compass是一个综合基准,用于评估分钟级音视频生成在文本、图像和视频条件模态下的表现,衡量长时间序列上的质量、一致性和对齐程度。
MultiRef-Compass: 迈向多参考到音频视频生成的全面评估
本文介绍了MultiRef-Compass,这是针对多参考到音频视频生成的全面基准,包含350个精心挑选的样本和评估协议,涵盖四个维度:基础质量、参考一致性、音视频一致性和指令遵循。
CoVEBench:视频编辑模型能否处理复杂指令?
引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。
VEFX-Bench:通用视频编辑与视觉特效的全方位基准
VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。
MSAVBench:迈向多镜头音视频生成的全面可靠评估
MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。