NARU:一个针对日本超长视频中叙事演进和文化细微差理解的基准
摘要
NARU 是一个评估日本超长视频中叙事演进和文化推理的基准,通过分层标注管道和母语者验证构建,以解决当前基准的空白。
查看缓存全文
缓存时间: 2026/08/21 12:09
论文页面 - NARU:针对日语极端长视频叙事演变与文化细微理解的基准测试
来源:https://huggingface.co/papers/2608.13210
摘要
NARU 是一个日语长视频基准测试,通过分层标注流程与大规模母语者验证,评估叙事演变和文化推理能力。
长视频理解(https://huggingface.co/papers?q=Long-form%20video%20understanding)涵盖超越检索孤立事件的任务,包括追踪不断演变的叙事,以及解读可能保持隐含的社会意义。然而,现有基准测试很少联合评估这些能力,尤其是在高语境、非英语媒体中。为弥补这一空白,我们推出了 NARU——一个旨在评估日语长视频中叙事演变(https://huggingface.co/papers?q=Narrative%20evolution)与文化理解推理(https://huggingface.co/papers?q=Reasoning%20on%20cultural%20Understanding)的基准测试。NARU 包含 1,481 个问题,基于 155 个视频(总计 146.8 小时),涵盖四个叙事维度和五个文化维度。为构建此规模基准,我们提出一种基于分层记忆的标注(https://huggingface.co/papers?q=hierarchical%20memory-based%20annotation)流程,将原始视频转化为结构化的事件、叙事和文化标注,然后通过面向任务的合成(https://huggingface.co/papers?q=task-oriented%20synthesis)与迭代捷径消除(https://huggingface.co/papers?q=shortcut%20removal)生成问题。构建过程包含两个涉及 68 名标注者的母语者验证阶段。在八种模型配置上的评估揭示,在长距离叙事整合与文化依据推理方面均存在显著局限性。通过揭示这些持续存在的差距,NARU 为开发能够可靠解读长视频、高语境内容的 MLLM(https://huggingface.co/papers?q=MLLMs)提供了一个系统化的测试平台。
查看 arXiv 页面(https://arxiv.org/abs/2608.13210)查看 PDF(https://arxiv.org/pdf/2608.13210)项目页面(https://ma-labo.github.io/naru/)GitHub3(https://github.com/infinimind-inc/naru_benchmark)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.13210)
在你的 agent 中获取此论文:
hf papers read 2608\.13210
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.13210 以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.13210 以从此页面链接。
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.13210 以从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
Web规模LLM预训练数据中叙事内容的特征刻画
对Web规模LLM预训练数据中叙事特征的细粒度研究,引入了NarraBERT和NarraDolma来测量叙事模式及其在不同来源中的分布。
NARRA-Gym:用于评估交互式叙事智能体的基准
本文介绍了 NARRA-Gym,这是一个基准和可执行评估环境,用于评估大型语言模型在多轮对话中维持交互式叙事、管理记忆以及适应用户的能力。
叙事知识编织器:面向长文本理解的叙事中心检索增强推理
提出叙事知识编织器(NKW),一种基于来源的框架,用于长文本理解中的叙事中心检索增强推理。它对齐文本证据、原子事实、图结构、实体档案和故事线,在剧本级故事世界QA基准上取得强劲结果。
NarrativeWorldBench:一个前沿饱和的基准测试和用于长程协作创作的音频剧的潜在世界模型
本文介绍了NarrativeWorldBench,一个用于评估音频剧中长程叙事一致性的基准测试,以及N-VSSM,一个潜在状态空间模型,它在多个时间跨度和语言上优于前沿大型语言模型。
Show HN:FastUbu – 超快视频归档
FastUbu 是一个工具,它将索引和转录等现代 AI 技术应用于已有 30 年历史的 Ubu 电影档案,旨在通过 Kino API 提供超快速的视频处理。