SpatialBlock: 通过合成堆叠方块问题增强LVLMs中的空间智能
摘要
本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。
查看缓存全文
缓存时间: 2026/09/11 06:16
论文页面 - SpatialBlock:通过合成积木堆叠任务增强大型视觉语言模型的空间智能
来源:https://huggingface.co/papers/2609.07064
摘要
在合成积木操作任务上训练的大型视觉语言模型能够提升三维空间推理能力,并泛化至真实世界的视觉任务。
大型视觉语言模型 (https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(LVLMs)在各种视觉任务上已表现出强大性能,但其重建并推理二维图像所描绘场景的三维结构——即空间智能 (https://huggingface.co/papers?q=spatial%20intelligence)——的能力仍然有限。现有方法试图通过使用需要密集几何标注的真实场景空间问答数据集来弥补这一差距。然而,构建此类标注成本高昂、耗时,且由于依赖外部感知模块,标注结果常常存在噪声。在本研究中,我们提出了一种受人类认知发展启发的新范式:通过结构化的积木操作任务学习基础空间技能。我们引入了 SpatialBlock-15k,这是一个包含15,000个积木堆叠问题的合成数据集,涵盖了三维到二维投影 (https://huggingface.co/papers?q=3D-to-2D%20projection)、视角变换 (https://huggingface.co/papers?q=viewpoint%20transformation) 和结构组合 (https://huggingface.co/papers?q=structural%20combination)。该数据集还整合了可控的颜色调制作为视觉线索,以鼓励在视觉复杂条件下进行基于锚点的推理 (https://huggingface.co/papers?q=anchor-based%20reasoning)。实验表明,通过直接回答或基于推理的预测 (https://huggingface.co/papers?q=reasoning-based%20prediction) 在我们数据集上训练的LVLMs,即使该数据集具有合成性和紧凑性,其性能也显著优于基线模型,并且能够泛化到真实世界的视觉任务中。代码和数据可在 https://github.com/rsoohyun/SpatialBlock 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2609.07064) 查看 PDF (https://arxiv.org/pdf/2609.07064) GitHub0 (https://github.com/rsoohyun/SpatialBlock) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07064)
在你的智能体中获取此论文:
hf papers read 2609\.07064
还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型6
rsoohyun/SpatialBlock-3B-direct 图像-文本到文本 • 4B • 更新于1天前 • 39 (https://huggingface.co/rsoohyun/SpatialBlock-3B-direct)
rsoohyun/SpatialBlock-7B-direct 图像-文本到文本 • 8B • 更新于1天前 • 40 (https://huggingface.co/rsoohyun/SpatialBlock-7B-direct)
rsoohyun/SpatialBlock-4B-direct 图像-文本到文本 • 4B • 更新于1天前 • 35 (https://huggingface.co/rsoohyun/SpatialBlock-4B-direct)
rsoohyun/SpatialBlock-3B-reason 图像-文本到文本 • 4B • 更新于1天前 • 40 (https://huggingface.co/rsoohyun/SpatialBlock-3B-reason)
浏览引用此论文的6个模型 (https://huggingface.co/models?other=arxiv:2609.07064)
引用此论文的数据集1
rsoohyun/SpatialBlock-15k 查看器 • 更新于1天前 • 15.6k • 57 • 1 (https://huggingface.co/datasets/rsoohyun/SpatialBlock-15k)
引用此论文的空间1
包含此论文的收藏集1
相似文章
MetaSpatial:强化VLMs在元宇宙中的3D空间推理
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力
介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
GeoStack:一种用于VLMs中拟阿贝尔知识组合的框架
GeoStack 引入了一种几何框架,用于在视觉语言模型中组合独立训练的领域专家,而不会出现灾难性遗忘,实现了常数时间推理,并将几何误差降低了10倍。