CineSubBench:基于多语言电影字幕评估大语言模型在长篇叙事和文化理解方面的能力

Hugging Face Daily Papers 论文

摘要

CineSubBench是一个基准,用于评估大语言模型在多语言电影字幕中长篇叙事和文化理解的能力,任务涵盖叙事重建、类型预测和安全性,涉及六种语言。

大语言模型在法律、医学、软件工程和网络安全等专业领域的评估日益增多,然而电影领域尽管需要长篇叙事整合、多语言解释和文化情境下的观众判断,却相对未被充分探索。我们推出了CineSubBench,这是一个评估基于多语言电影字幕的长上下文电影理解的基准。字幕轨道将电影表示为数千个短小的、时间顺序排列的语句,模型必须在没有明确场景或事件结构的情况下重建角色、关系、事件、因果进程和主题。CineSubBench包含1,012部电影,提供六种语言的完整字幕覆盖,产生6,072条轨道和8.13百万条带时间戳的字幕条目。它提供了一个匹配的多任务、多语言和多文化(MultiX)评估设置:七项任务涵盖叙事重建与抽象、类型预测、年龄适宜性、跨越十个国家分级系统的国家特定电影评级,以及基于字幕的语言安全性。在九个大语言模型中,情节前提比事件完整摘要恢复得更可靠;跨语言一致性在模型和语言之间差异显著;国家评级系统揭示了不同的校准模式;而强烈亵渎比轻度淫秽更容易验证。CineSubBench将电影确立为大语言模型的长上下文评估领域,并提供了一个统一的基准,用于测量叙事、多语言、文化和证据基础能力。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:23

论文页面 - CineSubBench:基于多语言电影字幕的长篇叙事与文化理解LLM评估基准

来源:https://huggingface.co/papers/2609.36218

摘要

大型语言模型在法律、医学、软件工程与网络安全等专业领域的评估日益增多,然而电影领域却相对缺乏探索,尽管其需要长篇叙事整合、多语言理解及基于文化语境的受众判断能力。我们提出CineSubBench——一个基于多语言电影字幕的长上下文电影理解评估基准。字幕轨道将电影表现为数千条按时间顺序排列的短句,模型需在没有明确场景或事件结构的情况下,从中重建角色关系、事件脉络、因果推进及主题思想。该基准包含1012部具备六种语言完整字幕的电影,生成6072条音轨与813万条带时间戳的字幕条目。它提供了匹配的多任务、多语言与跨文化(MultiX)评估设置:七项任务涵盖叙事重构与抽象、类型预测、适宜年龄、十个国家分级系统的特定国家电影评级,以及基于字幕的语言安全评估。在九个LLM的测试中,情节前提的恢复可靠度高于完整事件梗概;跨语言一致性因模型和语言而异;国家评级体系呈现差异化的校准模式;强烈脏话比轻度粗俗语言更易通过字幕定位。CineSubBench确立了电影作为长上下文LLM评估领域,并提供了衡量叙事、多语言、文化及证据溯源能力的统一基准。

查看arXiv页面 (https://arxiv.org/abs/2609.36218)查看PDF (https://arxiv.org/pdf/2609.36218)项目主页 (https://tafseer-nayeem.github.io/CineSubBench/)GitHub0 (https://github.com/tafseer-nayeem/CineSubBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36218)

通过您的代理获取本文:

hf papers read 2609\.36218

若无最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2609.36218以从本页链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2609.36218以从本页链接。

引用本文的空间0

无空间链接本文

在空间README.md中引用arxiv.org/abs/2609.36218以从本页链接。

包含本文的合集1

相似文章

热门好莱坞电影的多模态叙事理解评估

arXiv cs.AI

本文介绍了一个新的多模态基准,用于评估AI模型对好莱坞电影的叙事理解,解决了版权问题,并表明视觉语言和音视频模型在该任务上的表现低于人类水平的准确性。