SemComp-Bench:视频生成中的语义任务完成基准测试
摘要
SemComp-Bench 引入了一个用于评估视频生成中语义任务完成的基准,使用精选数据集和基于视觉语言模型的评估协议来评估结果达成度和生成可靠性。
查看缓存全文
缓存时间: 2026/08/20 04:02
论文页面 - SemComp-Bench:视频生成中语义任务完成的基准测试
来源:https://huggingface.co/papers/2608.17426
摘要
语义任务完成视频生成评估生成视频是否在具有语义依据的情况下实现预期结果,由一个精心策划的数据集和基于视觉语言模型的基准测试提供支持。
我们引入语义任务完成视频生成(https://huggingface.co/papers?q=Video%20Generation),这是一种以结果为导向的视频生成(https://huggingface.co/papers?q=video%20generation)任务。在此框架下,成功需要同时实现预期结果并具有语义依据(https://huggingface.co/papers?q=semantic%20grounding)。语义依据(https://huggingface.co/papers?q=Semantic%20grounding)刻画了参考图像与生成结果之间在与任务相关的高级语义层面的对应关系。评估侧重于生成的结果,既不需要呈现完整的中间任务步骤序列,也不需要与参考图像保持传统的外观一致性。为支持系统性评估,我们构建了 SemComp-Data,一个涵盖六个领域的评估数据集。每个实例包含一个参考图像、一个详细指令、一个简短指令和一个以结果为中心的视频片段。一个可扩展的四阶段策划流程将原始视频转换为标准化的 SemComp-Data 实例。我们进一步引入了 SemComp-Bench,这是一个使用视觉语言模型(https://huggingface.co/papers?q=vision-language%20model)(VLM)回答结构化二元问题的评估协议。SemComp-Bench 分别报告结果达成度(https://huggingface.co/papers?q=Outcome%20Achievement)和生成可靠性(https://huggingface.co/papers?q=Generation%20Reliability)的 OA 分数和 GR 分数。在代表性的视频生成(https://huggingface.co/papers?q=video%20generation)模型上的实验表明,在实现预期结果的同时,保持参考图像中与任务相关的语义依据(https://huggingface.co/papers?q=semantic%20grounding)仍然具有挑战性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.17426)查看 PDF (https://arxiv.org/pdf/2608.17426)项目页面 (https://semcomp-bench.github.io/)GitHub (https://github.com/Kelly372/SemComp-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17426)
通过你的代理获取此论文:
hf papers read 2608\.17426
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.17426 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.17426 以从此页面链接它。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.17426 以从此页面链接它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
生成式语义场景补全
本文提出了一种生成式语义场景补全方法,具有校正后的性能指标和实时推理能力,并发布了代码、权重和PS3语料库以供重现性研究。
RoboSemanticBench:诊断VLA模型动作预测中的语义基础
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
VGI-BENCH: 探测视频生成模型中的视觉智能
VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。
OSCBench: 文本到视频生成中的对象状态变化基准测试
OSCBench是一个新的基准测试,用于评估文本到视频生成模型准确表示对象状态变化(由剥皮或切片等动作引起的转变)的能力。该论文表明,当前的T2V模型在处理时间上一致的状态变化方面存在困难,特别是在新颖和组合场景中,这被认定为视频生成的一个关键瓶颈。