热门好莱坞电影的多模态叙事理解评估
摘要
本文介绍了一个新的多模态基准,用于评估AI模型对好莱坞电影的叙事理解,解决了版权问题,并表明视觉语言和音视频模型在该任务上的表现低于人类水平的准确性。
arXiv:2608.21430v1 Announce Type: new
摘要:多模态语言模型日益展现出在电影大规模计算分析方面的潜力,为学习电影历史和叙事技术演变开辟了新途径。但围绕好莱坞电影创建稳定的基准因版权保护而变得复杂。在这项工作中,我们直接解决这些关切,通过构建一个新的好莱坞电影集合,定义了两个标准:票房受欢迎程度(我们首次发布了由Variety杂志报告的1922年至1979年每周票房收入的大规模开放集合);以及可能的公有领域状态(通过研究美国版权登记目录中的版权注册和续期)。我们在这个集合上构建了一个新的多模态MCQ基准,专注于叙事元素,直接评估模型为电影叙事有意义研究提供信息的能力;我们发现许多视觉语言模型在该任务上表现不佳(许多模型的准确率接近随机水平),而音视频模型(包括在场景描述中使用音频的模型)的最高准确率为61.1%,远低于人类水平的表现。
查看缓存全文
缓存时间: 2026/08/25 04:16
# 评估流行好莱坞电影的多模态叙事理解能力
来源:https://arxiv.org/html/2608.21430
Kent K. Chang / Allison Cooper / Juishan Hsu
隶属机构:鲍登学院电影研究
Reina Kushihashi
隶属机构:加州大学伯克利分校
Madison Mar / Arnav Podichetty
隶属机构:加州大学伯克利分校
Rachael Samberg
隶属机构:加州大学伯克利分校
Ipek Nil Sancak
隶属机构:加州大学伯克利分校
隶属机构:学术交流与信息政策,加州大学伯克利分校
邮箱:{dbamman,kentkchang}@berkeley.edu
Yuhan Shao
隶属机构:加州大学伯克利分校
信息学院,加州大学伯克利分校
#### 摘要
多模态语言模型日益展现出推动电影大规模计算分析的潜力,为探索电影史及叙事技术演变开辟了新途径。但围绕好莱坞电影构建稳定基准面临版权保护的复杂挑战。本研究直接应对这些关切,通过两个标准建立新的好莱坞电影集合:票房流行度(我们首次公开发布《综艺》杂志1922–1979年间每周票房数据的开源大规模集合);以及可能处于公共领域状态(通过研究美国《版权登记目录》中的版权注册与续期信息)。基于此集合,我们构建了专注于叙事要素的新型多模态选择题基准,直接评估模型指导电影叙事实质性研究的能力;研究发现许多视觉语言模型在此任务上表现欠佳(多数准确率接近随机水平),而视听模型(包括利用音频进行场景描述的模型)最高准确率仅为61.1%,远低于人类水平。
## 1 引言
自然语言处理、计算机视觉与人工智能发展的最令人振奋的成果之一,是其作为分析工具在文化研究规模化应用中的潜力。虽然这类应用长期聚焦于文本领域(52 [https://arxiv.org/html/2608.21430#bib.bib2];39 [https://arxiv.org/html/2608.21430#bib.bib7]),但我们观察到电影分析领域的应用日益增多。这类研究揭示了节奏与亮度变化(14 [https://arxiv.org/html/2608.21430#bib.bib20])、银幕上种族与性别表征(26 [https://arxiv.org/html/2608.21430#bib.bib18];4 [https://arxiv.org/html/2608.21430#bib.bib19];7 [https://arxiv.org/html/2608.21430#bib.bib22])、喜剧节奏(60 [https://arxiv.org/html/2608.21430#bib.bib9])等多重维度(46 [https://arxiv.org/html/2608.21430#bib.bib6])。
然而,尽管其他应用领域的方法进步可通过开放基准的构建得以推动(15 [https://arxiv.org/html/2608.21430#bib.bib3];35 [https://arxiv.org/html/2608.21430#bib.bib5];32 [https://arxiv.org/html/2608.21430#bib.bib4]),电影作为研究对象因其底层材料的版权属性而面临独特挑战。尽管许多核心任务——从镜头边界分割(56 [https://arxiv.org/html/2608.21430#bib.bib16];47 [https://arxiv.org/html/2608.21430#bib.bib15])到角色识别(19 [https://arxiv.org/html/2608.21430#bib.bib17];37 [https://arxiv.org/html/2608.21430#bib.bib12])——常针对电影行业应用设计,但对受版权保护材料数字化与再发布的限制常使研究者无法直接获取基础数据。即使出于研究目的提取片段属于合理使用(对版权所有者专有权的例外),电影公司拥有成熟的许可市场,且常对本应属合理使用的行为提出异议。依赖从业者从YouTube等URL下载视频的数据集,也因用户移除视频或依据《数字千年版权法》移除通知而面临日益严格的访问限制。基于此类数据的基准缺乏稳定性。
应对该挑战的解决方案之一是基于公共领域电影构建基准。公共领域不仅包括1931年之前在美国发行的现有作品[^1],还包括版权所有者(通常为制片厂)在美国版权法要求版权续期注册的期间未完成续期的所有电影。但这本身也带来挑战:首先,公共领域材料尚无公认注册库,第三方声称某电影属公共领域的主张可能存疑;互联网档案馆等来源收录的故事片多数仍受版权保护,可能面临DMCA移除通知。其次,尽管数千部电影属公共领域,但其文化影响力参差不齐——公共领域包含美国政府发行的战争宣传片、制片厂因缺乏兴趣未续期版权的电影等。在围绕好莱坞电影构建基准时,我们还需纳入文化价值指标。
本研究通过数据采购的两项干预应对这些质疑:首先,确定电影在美国的文化影响力(以美国票房*流行度*衡量);其次,识别真正可能处于公共状态的电影——并非依赖第三方声称,而是通过美国《版权登记目录》核实该状态。这两个标准——文化价值与开放性——使我们的工作区别于其他包含好莱坞元素的数据集构建尝试(51 [https://arxiv.org/html/2608.21430#bib.bib21];41 [https://arxiv.org/html/2608.21430#bib.bib14];54 [https://arxiv.org/html/2608.21430#bib.bib10]),包括历史数据集(57 [https://arxiv.org/html/2608.21430#bib.bib1])。
基于这些标准定义的数据集,我们围绕其构建了测量多模态模型在长篇*叙事*理解任务上的表现基准,重点关注时间性、情节、角色、场景、视角、表征、象征与物体识别等问题。该基准使我们能够评估各类模型在日益推动计算社会科学与数字人文研究的测量任务上的表现。尽管先前基准已探索过长篇电影(57 [https://arxiv.org/html/2608.21430#bib.bib1];54 [https://arxiv.org/html/2608.21430#bib.bib10])及其他模态(如文本)的阐释任务(50 [https://arxiv.org/html/2608.21430#bib.bib11];27 [https://arxiv.org/html/2608.21430#bib.bib8]),但本研究首次将两种范式结合,评估此类模型如何助力我们分析理解电影中的复杂叙事现象。
本研究的贡献如下:
- • 我们首次系统构建了历史票房数据库(摘自《综艺》杂志),涵盖1922–1979年。该数据库公开于 https://github.com/bamman-group/variety-boxoffice。
- • 我们提出了新的流行电影数据集,这些电影很可能在美国属公共领域,可为其他研究者提供稳定可靠的基准基础。
- • 我们构建了新的电影叙事理解基准,并评估了多个多模态模型在该困难任务上的表现。研究发现许多视觉语言模型表现挣扎(多数准确率接近随机水平),而视听模型(包括利用音频进行场景描述的模型)最高表现仅为61.1%,远低于人类水平。该经典好莱坞叙事基准(及配套代码)公开于 https://github.com/bamman-group/chnb。
## 2 定义集合
### 2.1 识别流行电影
我们的首要目标是识别受欢迎的电影。美国历史票房数据支离破碎,主要信息来源包括个别制片厂高管保存的账簿(24 [https://arxiv.org/html/2608.21430#bib.bib27];30 [https://arxiv.org/html/2608.21430#bib.bib28];25 [https://arxiv.org/html/2608.21430#bib.bib26])以及《综艺》《电影先驱报》《好莱坞报道》等行业杂志。《综艺》拥有最悠久的票房信息收藏:自1922年3月3日首刊(并持续至21世纪初),该杂志报道特定影院单部电影的每周票房收入。图1(https://arxiv.org/html/2608.21430#S2.F1)展示了两则典型示例。
**图注**
**图1**:《综艺》1924年10月29日(左)与1934年7月10日(右)两期周刊的票房信息。在标注城市(华盛顿与印第安纳波利斯)的宽列下,每条记录列出影院、电影标题及当周票房估值。
我们从《综艺》所有包含“本周估算”“上周估算”短语的文章页面,或标题含“电影票房”短语的页面中,提取结构化元组——例如:⟨华盛顿,哥伦比亚影业,《泥土之足》,$12,000⟩。我们通过多模态大语言模型提示提取每页所有元组,提供两个示例(输入图像,输出JSON)以说明期望行为。《综艺》中的电影常使用简称(如1940年以“Gone”代指《乱世佳人》),依赖读者对该年度电影的普遍认知。针对每年出现至少3次的别名(“乱世佳人”“Gone”“Gone with Wind”等),我们手动创建其与IMDB记录的映射表。该流程使我们能够根据《综艺》报告的总票房数据,生成每年的电影排名列表。
为评估该提取方法的准确性,我们手动标注了1922–1979年间21期《综艺》中的4,072个元组,构建金标准数据集。使用其中7期进行开发,保留12期用于评估。我们主要通过斯皮尔曼等级相关系数评估有效性(比较人工元组与模型预测元组导出的排名),因为排名最终构成定义集合的标准(每年前100名电影)。评估发现Gemini 3 Pro(高思考模式与超高图像分辨率)在留出评估中表现最佳,ρ=0.961。完整评估流程详见附录B(https://arxiv.org/html/2608.21430#A2)。
我们使用该最佳模型提取1922–1979年所有《综艺》的结构化信息。通过汇总所有电影的总票房,我们编制了该时间段内每年的最卖座电影排名列表,涵盖24,000余部电影的140万周票房数据。据我们所知,这是首个公开可用、全面覆盖故事片历史票房的信息数据集。所有提取结果、别名映射及汇总年度/周榜数据公开于 https://github.com/bamman-group/variety-boxoffice。
这些榜单使我们得以定义流行度指标:若电影位列某年票房前100名,则纳入数据集范围。商业发行的故事片构成叙事理解基准的合理语料库,因其诞生于工业体系条件下,该体系优先保障叙事连贯性与广泛可读性——正是我们旨在评估的特性。《综艺》数据集富含经典好莱坞时代(广义指1917–1960年[8 https://arxiv.org/html/2608.21430#bib.bib37])的电影,该时期以制片厂制度、连续性剪辑系统等产业与美学发展为标志,旨在提升银幕叙事的清晰度与效率。该时期其他主导叙事趋势包括以角色为中心的因果逻辑、目标导向的情节、对叙事封闭性的强调(10 [https://arxiv.org/html/2608.21430#bib.bib38]),以及明星形象的演变(17 [https://arxiv.org/html/2608.21430#bib.bib40])、应对《好莱坞制作守则》的策略(29 [https://arxiv.org/html/2608.21430#bib.bib39])、类型惯例的形成与强化(2 [https://arxiv.org/html/2608.21430#bib.bib44])。
数据集亦涵盖后经典时期数年;该时代见证了角色中心因果逻辑的弱化(18 [https://arxiv.org/html/2608.21430#bib.bib41])、结局日益模糊(11 [https://arxiv.org/html/2608.21430#bib.bib43])、经典时期类型的重塑(42 [https://arxiv.org/html/2608.21430#bib.bib45])及欧洲艺术电影影响力的增长(9 [https://arxiv.org/html/2608.21430#bib.bib42])。
最后需注意,将票房作为重要性代理指标的局限性已有充分文献记载(36 [https://arxiv.org/html/2608.21430#bib.bib34];48 [https://arxiv.org/html/2608.21430#bib.bib29])。电影学者警示过度依赖商业指标,认为过于狭隘的方法会忽略美学重要作品(31 [https://arxiv.org/html/2608.21430#bib.bib30];44 [https://arxiv.org/html/2608.21430#bib.bib31])或电影更广阔的历史与社会语境(1 [https://arxiv.org/html/2608.21430#bib.bib32];53 [https://arxiv.org/html/2608.21430#bib.bib33])。以票房总额为主要标准构建流行电影集合,意味着我们的语料库排除了在美国主流发行渠道外流通的电影,包括默片时代的“种族电影”(49 [https://arxiv.org/html/2608.21430#bib.bib35])到跨国电影节电影(55 [https://arxiv.org/html/2608.21430#bib.bib36])。值得强调的是,票房仅是衡量电影数据集重要性的众多指标之一,可用于评估叙事的多模态理解。下一节详述的公共领域状态识别方法,可轻松适配以开发不同边界标准的基准。
### 2.2 核实公共领域状态
在美国,大多数1931年之前发行的电影已进入公共领域(截至本文撰写时);同样,1964年前注册版权但未在28年后续期的大多数电影也属公共领域。第一个标准允许我们通过出版年份相对容易地识别可能属公共领域的电影,但第二个标准更具挑战性,因为它需要:a) 确定电影的版权注册年份;b) 确认其*未*续期(包括电影改编自的任何剧本或表现性作品的续期,这些作品可能另有注册)[^2]。
[^1]: 版权保护具有固定期限。电影通常为法人作品,受保护期为发行后95年;截至2026年,1931年前发行的电影已进入公共领域。但问题复杂之处在于电影元素可能被修复,此类对原片的修改将受新版权保护。
[^2]: 版权续期仅对特定时段重要。相似文章
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
使用多模态语言模型检测社交媒体上的AI生成内容
来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试
本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。
MultivationBench:多模态序列动机推理基准
介绍了MultivationBench,这是一个基于马斯洛需求层次和赖斯基本欲望的故事驱动视觉叙事,用于评估多模态大语言模型序列动机推理能力的基准。结果表明,所有测试模型在动态动机推断方面均表现不佳。