Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力
摘要
介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。
查看缓存全文
缓存时间: 2026/06/01 11:20
论文页面 - Flat-Pack Bench: 通过家具组装评估大型视觉-语言模型的时空理解能力
来源:https://huggingface.co/papers/2605.21625
摘要
大型视觉-语言模型在细粒度时空推理与追踪能力方面存在显著局限,这一结论源于一种新的家具组装基准测试的评估。
大型视觉-语言模型(Large Vision-Language Models,简称LVLMs)的出现显著推动了视频理解(https://huggingface.co/papers?q=video%20understanding)能力的发展。然而,现有基准主要侧重于粗粒度任务,如动作分割(https://huggingface.co/papers?q=action%20segmentation)、分类(https://huggingface.co/papers?q=classification)、描述(https://huggingface.co/papers?q=captioning)和检索(https://huggingface.co/papers?q=retrieval)。此外,这些基准通常依赖易于通过语言识别的实体,如家用物品、动物、人类主体等,从而限制了其在复杂真实视频场景中的适用性。但许多应用,如家具组装、烹饪等,需要对视频进行逐步的细粒度时空理解,而当前基准尚未对此进行充分评估。为弥补这一不足,我们提出了Flat-Pack Bench,一个以家具组装任务为核心的新型基准。该基准通过多项选择题结合视觉提示(突出显示相关部分作为细粒度问题的参考),评估LVLMs在精细任务上的表现,包括组装动作的时间排序(https://huggingface.co/papers?q=temporal%20ordering)、组装状态的时间定位(https://huggingface.co/papers?q=temporal%20localization)、零件配合(https://huggingface.co/papers?q=part%20mating)理解以及追踪(https://huggingface.co/papers?q=tracking)。实验表明,最先进的LVLMs在细粒度时空推理(https://huggingface.co/papers?q=spatio-temporal%20reasoning)方面表现困难,凸显了其在有效利用视频时间信息、有限的追踪(https://huggingface.co/papers?q=tracking)能力以及对物理接触等空间交互理解方面的不足。
查看arXiv页面(https://arxiv.org/abs/2605.21625) 查看PDF(https://arxiv.org/pdf/2605.21625) 项目页面(https://flat-pack-bench.github.io/) GitHub(https://github.com/justachetan/flat-pack-bench) 添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21625)
在您的代理中获取这篇论文:
hf papers read 2605\.21625
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.21625,以便从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.21625,以便从此页面链接。
引用此论文的Space0
没有Space链接此论文
请在Space README.md 中引用 arxiv.org/abs/2605.21625,以便从此页面链接。
包含此论文的收藏1
相似文章
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
基于大型视觉-语言模型利用遥感影像进行建成环境推理
本文探讨了利用大型视觉-语言模型处理遥感影像以进行建成环境推理任务(如设计建议和风险识别)。研究评估了 InternVL 和 Qwen 等模型,突显了其在支持智慧城市决策和定量推理方面的潜力。
P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试
本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。
AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。