SemComp-Bench:视频生成中的语义任务完成基准测试

Hugging Face Daily Papers 论文

摘要

SemComp-Bench 引入了一个用于评估视频生成中语义任务完成的基准,使用精选数据集和基于视觉语言模型的评估协议来评估结果达成度和生成可靠性。

我们引入了语义任务完成视频生成,这是一个面向结果的视频生成任务。在这种框架下,成功需要同时实现预期结果和语义基础。语义基础表征了参考图像与生成结果之间在任务相关高层语义上的对应关系。评估侧重于生成的结果,既不需要展示完整的中间任务步骤序列,也不需要与参考图像保持传统的外观一致性。为了支持系统评估,我们构建了SemComp-Data,一个涵盖六个领域的评估数据集。每个实例包括一个参考图像、一个详细指令、一个简要指令和一个以结果为中心的视频片段。一个可扩展的四阶段策展流水线将原始视频转换为标准化的SemComp-Data实例。我们进一步引入了SemComp-Bench,这是一个评估协议,使用视觉语言模型(VLM)来回答结构化的二元问题。SemComp-Bench分别报告结果达成度(OA分数)和生成可靠性(GR分数)。在代表性视频生成模型上的实验表明,实现预期结果同时保持参考图像中与任务相关的语义基础仍然具有挑战性。
查看原文
查看缓存全文

缓存时间: 2026/08/20 04:02

论文页面 - SemComp-Bench:视频生成中语义任务完成的基准测试

来源:https://huggingface.co/papers/2608.17426

摘要

语义任务完成视频生成评估生成视频是否在具有语义依据的情况下实现预期结果,由一个精心策划的数据集和基于视觉语言模型的基准测试提供支持。

我们引入语义任务完成视频生成(https://huggingface.co/papers?q=Video%20Generation),这是一种以结果为导向的视频生成(https://huggingface.co/papers?q=video%20generation)任务。在此框架下,成功需要同时实现预期结果并具有语义依据(https://huggingface.co/papers?q=semantic%20grounding)。语义依据(https://huggingface.co/papers?q=Semantic%20grounding)刻画了参考图像与生成结果之间在与任务相关的高级语义层面的对应关系。评估侧重于生成的结果,既不需要呈现完整的中间任务步骤序列,也不需要与参考图像保持传统的外观一致性。为支持系统性评估,我们构建了 SemComp-Data,一个涵盖六个领域的评估数据集。每个实例包含一个参考图像、一个详细指令、一个简短指令和一个以结果为中心的视频片段。一个可扩展的四阶段策划流程将原始视频转换为标准化的 SemComp-Data 实例。我们进一步引入了 SemComp-Bench,这是一个使用视觉语言模型(https://huggingface.co/papers?q=vision-language%20model)(VLM)回答结构化二元问题的评估协议。SemComp-Bench 分别报告结果达成度(https://huggingface.co/papers?q=Outcome%20Achievement)和生成可靠性(https://huggingface.co/papers?q=Generation%20Reliability)的 OA 分数和 GR 分数。在代表性的视频生成(https://huggingface.co/papers?q=video%20generation)模型上的实验表明,在实现预期结果的同时,保持参考图像中与任务相关的语义依据(https://huggingface.co/papers?q=semantic%20grounding)仍然具有挑战性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.17426)查看 PDF (https://arxiv.org/pdf/2608.17426)项目页面 (https://semcomp-bench.github.io/)GitHub (https://github.com/Kelly372/SemComp-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17426)

通过你的代理获取此论文:

hf papers read 2608\.17426

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.17426 以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.17426 以从此页面链接它。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.17426 以从此页面链接它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

生成式语义场景补全

Hugging Face Daily Papers

本文提出了一种生成式语义场景补全方法,具有校正后的性能指标和实时推理能力,并发布了代码、权重和PS3语料库以供重现性研究。

OSCBench: 文本到视频生成中的对象状态变化基准测试

arXiv cs.CL

OSCBench是一个新的基准测试,用于评估文本到视频生成模型准确表示对象状态变化(由剥皮或切片等动作引起的转变)的能力。该论文表明,当前的T2V模型在处理时间上一致的状态变化方面存在困难,特别是在新颖和组合场景中,这被认定为视频生成的一个关键瓶颈。