CineSubBench:基于多语言电影字幕评估大语言模型在长篇叙事和文化理解方面的能力
摘要
CineSubBench是一个基准,用于评估大语言模型在多语言电影字幕中长篇叙事和文化理解的能力,任务涵盖叙事重建、类型预测和安全性,涉及六种语言。
查看缓存全文
缓存时间: 2026/09/30 04:23
论文页面 - CineSubBench:基于多语言电影字幕的长篇叙事与文化理解LLM评估基准
来源:https://huggingface.co/papers/2609.36218
摘要
大型语言模型在法律、医学、软件工程与网络安全等专业领域的评估日益增多,然而电影领域却相对缺乏探索,尽管其需要长篇叙事整合、多语言理解及基于文化语境的受众判断能力。我们提出CineSubBench——一个基于多语言电影字幕的长上下文电影理解评估基准。字幕轨道将电影表现为数千条按时间顺序排列的短句,模型需在没有明确场景或事件结构的情况下,从中重建角色关系、事件脉络、因果推进及主题思想。该基准包含1012部具备六种语言完整字幕的电影,生成6072条音轨与813万条带时间戳的字幕条目。它提供了匹配的多任务、多语言与跨文化(MultiX)评估设置:七项任务涵盖叙事重构与抽象、类型预测、适宜年龄、十个国家分级系统的特定国家电影评级,以及基于字幕的语言安全评估。在九个LLM的测试中,情节前提的恢复可靠度高于完整事件梗概;跨语言一致性因模型和语言而异;国家评级体系呈现差异化的校准模式;强烈脏话比轻度粗俗语言更易通过字幕定位。CineSubBench确立了电影作为长上下文LLM评估领域,并提供了衡量叙事、多语言、文化及证据溯源能力的统一基准。
查看arXiv页面 (https://arxiv.org/abs/2609.36218)查看PDF (https://arxiv.org/pdf/2609.36218)项目主页 (https://tafseer-nayeem.github.io/CineSubBench/)GitHub0 (https://github.com/tafseer-nayeem/CineSubBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36218)
通过您的代理获取本文:
hf papers read 2609\.36218
若无最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型README.md中引用arxiv.org/abs/2609.36218以从本页链接。
引用本文的数据集0
无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2609.36218以从本页链接。
引用本文的空间0
无空间链接本文
在空间README.md中引用arxiv.org/abs/2609.36218以从本页链接。
包含本文的合集1
相似文章
CLIP-CC-Bench: 评估视频-语言模型中的段落级视频描述
介绍了CLIP-CC-Bench,一个用于评估视频-语言模型在电影片段段落级描述上的基准,包含200个片段和人工参考段落。测试了17个模型,发现长格式视频描述仍未解决。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
CulturALL:评测大模型多语言多文化能力的实景基准
CulturALL 发布含 2,610 条样本、覆盖 14 种语言和 51 个地区的实景基准,用于检验大模型在真实文化场景下的表现;目前最佳模型仅得 44.48%,提升空间巨大。
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
热门好莱坞电影的多模态叙事理解评估
本文介绍了一个新的多模态基准,用于评估AI模型对好莱坞电影的叙事理解,解决了版权问题,并表明视觉语言和音视频模型在该任务上的表现低于人类水平的准确性。