TempCloze: 视频大语言模型能否识别缺失的中间部分?
摘要
TempCloze 是一个视频完形填空基准,用于评估视频大语言模型中的视觉时序推理,要求模型从干扰项中识别缺失的视频片段,以减少在语义、对齐和进展方面的语言捷径。
查看缓存全文
缓存时间: 2026/09/11 10:17
论文页面 - TempCloze:视频大语言模型能否识别缺失的中间环节?
来源:https://huggingface.co/papers/2609.01515
摘要
TempCloze 通过要求从针对语义、对齐和演进的干扰项中识别缺失的视频片段,来评估视频大语言模型的视觉时序推理能力。
针对视频大语言模型的时序推理 (https://huggingface.co/papers?q=Temporal%20reasoning) 基准测试通常依赖于语言,从而为来自选项措辞、答案关联或语言先验的语言快捷方式留下了空间。为减少此类快捷方式,我们推出了 TempCloze,这是一个视频填空 (https://huggingface.co/papers?q=video%20cloze) 基准测试,用于评估视频大语言模型 (https://huggingface.co/papers?q=Video-LLMs) 的视觉时序推理 (https://huggingface.co/papers?q=temporal%20reasoning) 能力。给定视频的起始和结束片段,模型必须从四个候选片段中识别出真正的缺失中间部分。TempCloze 包含来自七个来源、经过精心筛选的 1,521 个视频,主要是长镜头和第一人称视角视频。我们沿着三个维度构建了同源干扰项 (https://huggingface.co/papers?q=same-source%20distractors):语义维度询问应发生何种事件,对齐维度探究事件应在何时发生,演进维度 (https://huggingface.co/papers?q=Progression) 测试事件应如何展开,同时共享的场景和物体减少了外观线索。我们对 10 个闭源和 21 个开源视频大语言模型 (https://huggingface.co/papers?q=Video-LLMs) 的评估揭示,对齐是主要瓶颈:模型通常能识别合理的语义内容和局部事件演进 (https://huggingface.co/papers?q=progression),但在时序对齐方面存在困难。我们进一步在 TempCloze-Mixed 和 TempCloze-Hard 数据集上,针对四个代表性模型进行了错误模式和行为敏感性分析,以探究错误来源以及候选顺序、上下文方向、可见跨度、帧密度和测试时扩展 (https://huggingface.co/papers?q=test-time%20scaling) 如何影响模型的选择。
查看 arXiv 页面 (https://arxiv.org/abs/2609.01515) 查看 PDF (https://arxiv.org/pdf/2609.01515) GitHub5 (https://github.com/CedricPei/Temporal-Cloze) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01515)
在你的代理中获取此论文:
hf papers read 2609\.01515
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.01515 以从本页面链接。
引用此论文的数据集 1
CedPei/TempCloze Viewer • 约 16 小时前更新 • 1.52k (https://huggingface.co/datasets/CedPei/TempCloze)
引用此论文的 Spaces 0
没有 Space 链接此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.01515 以从本页面链接。
包含此论文的收藏 0
没有收藏包含此论文。
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
TimeLens2: 通用视频时间定位与多模态大语言模型
TimeLens2 提出了一种使用多模态大语言模型的通用视频时间定位方法,将时间证据视为区间集,在多个基准上取得了最先进的性能。
当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测
本文研究了多模态大语言模型(MLLMs)在视频理解任务中检测正确答案缺失的能力,发现模型系统性地失败,倾向于选择合理的干扰项而非识别出没有有效选项。该失败在时序推理和密集帧采样中更为严重,而思维链提示仅能部分缓解问题。
LLMs何时会适用错误法律?诊断LLMs在时序法律推理中的失败
本文构建了一个基准来评估LLMs在时序法律推理上的表现,揭示了它们倾向于适用最新颁布的法律的偏见,以及通用推理能力与时序性能之间的反向关系。
机器的内部时钟:大语言模型是否共享人类的时间错觉?
本文探讨大语言模型是否表现出类似人类的时间错觉,通过在叙事基准上进行测试,发现大语言模型经常选择与心理学文献一致的场景,而不是模仿人类的感知。