SpaceDG:视觉退化下的空间智能基准测试
摘要
SpaceDG是一个大规模数据集和基准测试,用于评估多模态语言模型在运动模糊、低光照等视觉退化条件下的空间推理鲁棒性,揭示了显著的性能差距,并表明在SpaceDG上进行微调可在不降低干净图像性能的前提下提升鲁棒性。
查看缓存全文
缓存时间: 2026/05/22 06:27
论文页面 - SpaceDG: 视觉退化场景下的空间智能基准测试
来源:https://huggingface.co/papers/2605.22536 作者:
,
,
,
,
,
,
,
,
,
摘要
SpaceDG 数据集和基准测试评估了多模态语言模型在视觉退化条件下的空间推理鲁棒性,揭示了显著的性能差距,并展示了通过针对性训练能够提升鲁棒性。
多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models,MLLMs)在空间智能(https://huggingface.co/papers?q=spatial%20intelligence)方面取得了快速进展,但现有的空间推理基准测试大多假设输入为完美视觉,忽略了实际部署中常见的退化情况,如运动模糊、低光照、恶劣天气、镜头畸变和压缩伪影。这引出一个根本性问题:当视觉观测不完美时,当前多模态大语言模型的空间智能鲁棒性如何?为了回答这个问题,我们提出了 SpaceDG,这是首个面向退化感知空间理解的大规模数据集。它基于物理驱动的退化合成引擎构建,将退化形成过程融入3D Gaussian Splatting(https://huggingface.co/papers?q=3D%20Gaussian%20Splatting,3DGS)渲染中,从而实现对九种退化类型的逼真模拟。最终生成的数据集包含近 1,000 个室内场景的约 100 万条问答对。我们还引入了 SpaceDG-Bench,这是一个经过人工验证的基准测试,包含 1,102 个问题,涵盖 11 个推理类别和 9 种视觉退化类型,产生了超过 10,000 个 VQA 实例。对 25 个开源和闭源多模态大语言模型的评估显示,视觉退化会持续且显著地削弱空间推理能力,暴露出关键的鲁棒性差距。最后,我们证明在 SpaceDG 上进行微调显著提升了退化鲁棒性,甚至在退化条件下能够超越人类表现,同时不降低在干净图像上的性能,这表明退化感知训练对于鲁棒空间智能具有前景。
查看 arXiv 页面(https://arxiv.org/abs/2605.22536) 查看 PDF(https://arxiv.org/pdf/2605.22536) 项目页面(https://visionary-laboratory.github.io/SpaceDG/) GitHub15(https://github.com/Visionary-Laboratory/SpaceDG) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22536)
在您的代理中获取此论文:
hf papers read 2605.22536
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型(0 个)
尚无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.22536 以将其链接至此页面。
引用本论文的数据集(0 个)
尚无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.22536 以将其链接至此页面。
引用本论文的 Spaces(0 个)
尚无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.22536 以将其链接至此页面。
包含本论文的收藏集(0 个)
尚无收藏集包含此论文
请将此论文添加到收藏集(https://huggingface.co/new-collection)以将其链接至此页面。
相似文章
GPT-6 Astra 成功通过了所有 48 个关卡的《I'm Not A Robot》游戏
GPT-6 Astra 成功通过了所有 48 个关卡的《I'm Not A Robot》游戏,展示了在交互式挑战环境中的先进 AI 能力。
IBM 发布最先进 Granite Time Series PatchTST-FM-r2 模型,采用商业友好型许可
IBM 发布了 Granite Time Series PatchTST-FM-r2 模型,这是一个 385M 参数的基础模型,用于零样时间序列预测,在 GIFT-Eval 基准测试中表现顶尖,并采用商业友好的 Apache 2.0 许可。
Programmable World Model
可编程世界模型引入了一个框架,将世界状态演化与视觉生成解耦,通过可执行程序和3D边界框实现持久且可控的环境。
@gdb:团队一直在研发
OpenAI的新AI模型,GPT-Image-2.5-Sunburst和Flare,在文本到图像和图像编辑领域取得了顶级排名,显示出相比前代版本的显著改进。
Qwen3.8-Flash-Next在llama.cpp vs SGLang vs FreeToken中的比较:完整上下文下首token时间从35秒到258秒。我对即将引入引擎的新PR的研究发现。
在完整上下文下对SGLang、llama.cpp和FreeToken在Qwen3.8-Flash-Next上的基准测试显示,SGLang实现最快的首token时间为35.4秒,而llama.cpp基线耗时258.4秒,推测解码提供了性能提升。