SpatialBlock: 通过合成堆叠方块问题增强LVLMs中的空间智能

Hugging Face Daily Papers 论文

摘要

本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。

大型视觉语言模型(LVLMs)在各种视觉任务中表现优异,但它们从2D图像中重建和推理场景3D结构的能力——即空间智能——仍然有限。现有方法尝试通过使用需要密集几何标注的真实场景空间问答数据集来填补这一空白。然而,构建此类标签成本高昂、耗时,且常因依赖外部感知模块而引入噪声。在本研究中,我们提出了一种受人类认知发展启发的新型范式:通过结构化的方块操作任务学习基础空间技能。我们引入了SpatialBlock-15k,这是一个包含15,000个堆叠方块问题的合成数据集,涵盖3D到2D投影、视角变换和结构组合。该数据集进一步融入了受控的颜色调制作为视觉线索,以鼓励在视觉复杂条件下的锚点推理。实验表明,通过直接回答或基于推理的预测使用我们的数据集训练的LVLMs,显著优于基线方法,并能泛化到现实世界的空间任务,尽管该数据集是合成且紧凑的。代码和数据可在 https://github.com/rsoohyun/SpatialBlock 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/11 06:16

论文页面 - SpatialBlock:通过合成积木堆叠任务增强大型视觉语言模型的空间智能

来源:https://huggingface.co/papers/2609.07064

摘要

在合成积木操作任务上训练的大型视觉语言模型能够提升三维空间推理能力,并泛化至真实世界的视觉任务。

大型视觉语言模型 (https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(LVLMs)在各种视觉任务上已表现出强大性能,但其重建并推理二维图像所描绘场景的三维结构——即空间智能 (https://huggingface.co/papers?q=spatial%20intelligence)——的能力仍然有限。现有方法试图通过使用需要密集几何标注的真实场景空间问答数据集来弥补这一差距。然而,构建此类标注成本高昂、耗时,且由于依赖外部感知模块,标注结果常常存在噪声。在本研究中,我们提出了一种受人类认知发展启发的新范式:通过结构化的积木操作任务学习基础空间技能。我们引入了 SpatialBlock-15k,这是一个包含15,000个积木堆叠问题的合成数据集,涵盖了三维到二维投影 (https://huggingface.co/papers?q=3D-to-2D%20projection)、视角变换 (https://huggingface.co/papers?q=viewpoint%20transformation) 和结构组合 (https://huggingface.co/papers?q=structural%20combination)。该数据集还整合了可控的颜色调制作为视觉线索,以鼓励在视觉复杂条件下进行基于锚点的推理 (https://huggingface.co/papers?q=anchor-based%20reasoning)。实验表明,通过直接回答或基于推理的预测 (https://huggingface.co/papers?q=reasoning-based%20prediction) 在我们数据集上训练的LVLMs,即使该数据集具有合成性和紧凑性,其性能也显著优于基线模型,并且能够泛化到真实世界的视觉任务中。代码和数据可在 https://github.com/rsoohyun/SpatialBlock 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2609.07064) 查看 PDF (https://arxiv.org/pdf/2609.07064) GitHub0 (https://github.com/rsoohyun/SpatialBlock) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07064)

在你的智能体中获取此论文:

hf papers read 2609\.07064

还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型6

rsoohyun/SpatialBlock-3B-direct 图像-文本到文本 • 4B • 更新于1天前 • 39 (https://huggingface.co/rsoohyun/SpatialBlock-3B-direct)

rsoohyun/SpatialBlock-7B-direct 图像-文本到文本 • 8B • 更新于1天前 • 40 (https://huggingface.co/rsoohyun/SpatialBlock-7B-direct)

rsoohyun/SpatialBlock-4B-direct 图像-文本到文本 • 4B • 更新于1天前 • 35 (https://huggingface.co/rsoohyun/SpatialBlock-4B-direct)

rsoohyun/SpatialBlock-3B-reason 图像-文本到文本 • 4B • 更新于1天前 • 40 (https://huggingface.co/rsoohyun/SpatialBlock-3B-reason)

浏览引用此论文的6个模型 (https://huggingface.co/models?other=arxiv:2609.07064)

引用此论文的数据集1

rsoohyun/SpatialBlock-15k 查看器 • 更新于1天前 • 15.6k • 57 • 1 (https://huggingface.co/datasets/rsoohyun/SpatialBlock-15k)

引用此论文的空间1

包含此论文的收藏集1

相似文章

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。