Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力

Hugging Face Daily Papers 论文

摘要

介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。

大型视觉-语言模型(LVLMs)的出现显著提升了视频理解能力。然而,现有基准测试主要关注粗粒度任务,如动作分割、分类、描述生成和检索。此外,这些基准测试通常依赖于易于用语言识别的实体,如家用物品、动物、人类主体等,限制了其在复杂、真实世界视频场景中的适用性。但是,许多应用(如家具组装、烹饪等)需要对视频进行逐步的细粒度时空理解,而当前的基准测试对此评估不足。为了解决这一差距,我们引入了Flat-Pack Bench,这是一个以家具组装任务为中心的新型基准测试。我们的基准测试通过多项选择题并配以突出显示相关部分的视觉提示作为细粒度问题的参考,来评估LVLMs在细粒度任务上的表现,包括组装动作的时间顺序、组装状态的时间定位、部件配合理解和跟踪。我们的实验表明,最先进的LVLMs在细粒度时空推理方面存在显著困难,凸显了它们在有效利用视频中的时间信息、有限的跟踪能力以及理解物理接触等空间交互方面的局限性。
查看原文
查看缓存全文

缓存时间: 2026/06/01 11:20

论文页面 - Flat-Pack Bench: 通过家具组装评估大型视觉-语言模型的时空理解能力

来源:https://huggingface.co/papers/2605.21625

摘要

大型视觉-语言模型在细粒度时空推理与追踪能力方面存在显著局限,这一结论源于一种新的家具组装基准测试的评估。

大型视觉-语言模型(Large Vision-Language Models,简称LVLMs)的出现显著推动了视频理解(https://huggingface.co/papers?q=video%20understanding)能力的发展。然而,现有基准主要侧重于粗粒度任务,如动作分割(https://huggingface.co/papers?q=action%20segmentation)、分类(https://huggingface.co/papers?q=classification)、描述(https://huggingface.co/papers?q=captioning)和检索(https://huggingface.co/papers?q=retrieval)。此外,这些基准通常依赖易于通过语言识别的实体,如家用物品、动物、人类主体等,从而限制了其在复杂真实视频场景中的适用性。但许多应用,如家具组装、烹饪等,需要对视频进行逐步的细粒度时空理解,而当前基准尚未对此进行充分评估。为弥补这一不足,我们提出了Flat-Pack Bench,一个以家具组装任务为核心的新型基准。该基准通过多项选择题结合视觉提示(突出显示相关部分作为细粒度问题的参考),评估LVLMs在精细任务上的表现,包括组装动作的时间排序(https://huggingface.co/papers?q=temporal%20ordering)、组装状态的时间定位(https://huggingface.co/papers?q=temporal%20localization)、零件配合(https://huggingface.co/papers?q=part%20mating)理解以及追踪(https://huggingface.co/papers?q=tracking)。实验表明,最先进的LVLMs在细粒度时空推理(https://huggingface.co/papers?q=spatio-temporal%20reasoning)方面表现困难,凸显了其在有效利用视频时间信息、有限的追踪(https://huggingface.co/papers?q=tracking)能力以及对物理接触等空间交互理解方面的不足。

查看arXiv页面(https://arxiv.org/abs/2605.21625) 查看PDF(https://arxiv.org/pdf/2605.21625) 项目页面(https://flat-pack-bench.github.io/) GitHub(https://github.com/justachetan/flat-pack-bench) 添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21625)

在您的代理中获取这篇论文:

hf papers read 2605\.21625

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.21625,以便从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.21625,以便从此页面链接。

引用此论文的Space0

没有Space链接此论文

请在Space README.md 中引用 arxiv.org/abs/2605.21625,以便从此页面链接。

包含此论文的收藏1

相似文章

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。