FilmBench:一个电影级视频生成基准

Hugging Face Daily Papers 论文

摘要

FilmBench是一个面向电影级视频生成的新基准,其提示源自跨越20种类型的获奖影片,并采用包含35+子指标的三级电影级分类体系。它包含一个开源自动化评估代理(FilmOps),该代理以高相关性复现人工模型排名,揭示了动态美学和多镜头表现方面的显著差距,相较于以往的网页风格基准。

视频生成的进展不断缩小AI生成内容与专业制作画面之间的视觉差距,但大多数基准仍从网页来源或LLM模板中提取提示,并用未经训练的通用多模态模型进行评分。更根本的是,它们的评估分类体系仍然粗放(整体视觉质量、粗略的文本对齐和时间平滑性),而非电影实际制作和评判所依据的专业电影语言标准,因此它们评估的是基本视频合理性而非电影级技艺。我们提出FilmBench,这是一个文本到视频(T2V)和参考到视频(R2V)基准,基于电影学院传统的专业电影语言,并与北京电影学院及互竞数字媒体与娱乐集团电影工作室的导演和教师共同开发。它基于三个选择。第一,提示是通过逆向工程从跨越20种电影类型的获奖影片片段中提取的,并由专业导演选定,因此每个提示都锚定在一个经过验证的真人动作参考上;提示遵循真实的镜头列表,大多数提示包含多个镜头(1,169个提示中有1,056个是多镜头),不同于以往的单镜头基准。第二,评估遵循一个三级电影级分类体系,包含3个轴、12个组件和35个(T2V)+3个(仅R2V)子指标。第三,我们开发了一个内部专家级自动化评估代理,并开源其核心电影语言算子套件(FilmOps)。通过对领先视频生成模型(9个T2V模型,7个R2V模型)进行基准测试,该评估器在模型级别上复现了人工模型排名,Spearman ho = 0.95 (T2V)和0.96 (R2V)。得分远低于以往的网页风格基准,存在两个一致的差距:动态美学方面,以及从单镜头到多镜头的显著性能下降,且较弱的模型下降更大。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

论文页面 - FilmBench:面向电影级视频生成的一个电影级基准

来源:https://huggingface.co/papers/2607.24241

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

视频生成的进步不断缩小AI生成画面与专业制作画面之间的视觉差距,然而大多数基准测试仍然从网络来源或LLM模板中提取提示词,并使用未经训练的通用多模态模型进行评分。更根本的是,其评估分类体系仍然十分初级(整体视觉质量、粗略的文本对齐和时序平滑度),而非专业电影语言标准——而电影正是依据这些标准制作和评判的。因此,它们评估的是基本的视频合理性,而非电影级技艺。我们提出FilmBench,这是一个基于电影学院传统中专业电影语言的文本到视频(T2V)和参考到视频(R2V)基准,并与北京电影学院及虎鲸数字传媒娱乐集团电影制片厂的导演和教师共同开发。它基于三个选择:第一,提示词是从跨越20种电影类型的获奖影片片段中逆向工程而来,并由专业导演挑选,因此每个提示词都锚定于经过验证的实拍参考;提示词遵循真实的拍摄脚本,并且大多数包含多个镜头(1169个提示词中有1056个是多镜头),这与以往的单片段基准不同。第二,评估遵循一个三级电影分类体系,包含3个轴、12个组件和35个(T2V)+3个(仅R2V)子指标。第三,我们开发了一个内部专家级自动评估智能体,并开源其电影语言算子的评分套件(FilmOps)。对领先视频生成模型(9个T2V模型、7个R2V模型)进行基准测试后,该评估器在模型层面复现了人类模型排名,Spearman相关系数分别为0.95(T2V)和0.96(R2V)。分数远低于之前网络风格的基准测试,且在动态美学方面存在两个一致的差距,同时从单镜头到多镜头的性能显著下降,并且对于较弱的模型,这种下降更为明显。

查看 arXiv 页面 (https://arxiv.org/abs/2607.24241) 查看 PDF (https://arxiv.org/pdf/2607.24241) GitHub2 (https://github.com/Neo-yk/FilmOps) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24241)

在你的智能体中获取此论文:

hf papers read 2607.24241

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.24241 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.24241 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.24241 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。

@samsja19:很棒的基准

X AI KOLs Following

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。

FrameBench:基于框架语义的语言理解基准

arXiv cs.CL

FrameBench 是一个新的基准,用于评估大型语言模型是否能区分动词在上下文中的依赖框架语义的解释,针对英语和日语构建,使用 FrameNet 资源,并随代码发布。

MemoBench:动态变化环境中世界建模的基准测试

Hugging Face Daily Papers

MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。