SpatialCLI:先使用空间工具推理,再脱离工具
摘要
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
查看缓存全文
缓存时间: 2026/07/31 01:51
论文页面 - SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理
来源:https://huggingface.co/papers/2607.27703
作者:, , , , , , , , , , ,
摘要
视觉语言模型(VLM)越来越多地被用于具身智能体,以解释视觉输入、推理空间关系,并基于该推理做出任务级决策。然而,一个根本性的能力错配依然存在:通用VLM能够推理整体任务,但往往会遗漏决定成败的视觉细节,而专业视觉模型能够捕捉这些细节,却无法将其转化为任务级决策。在这项工作中,我们提出了SpatialCLI,一个教会VLM使用空间工具进行推理,并逐步内化这些工具所提供的专业感知能力的框架。SpatialCLI分为三个阶段:(1)调用(Call):将专业视觉模型暴露为空间工具,以增强VLM的感知;(2)学习(Learn):使用冷启动SFT和智能体强化学习(agentic RL)来改进工具使用;(3)内化(Internalize):将成功的工具使用轨迹言语化,从而内化专业感知能力。我们进一步引入了SpatialCLI-Bench,一个包含516个示例的基准,涵盖定位、分割、深度和位姿的组合感知任务。在MindCube上,SpatialCLI将Qwen3-VL-8B-Instruct从29.3%提升至使用工具时的84.6%,超过了使用工具的GPT-5.6 Sol(72.1%),而在内化后,不使用工具时仍保持了73.8%的性能。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27703) 查看 PDF (https://arxiv.org/pdf/2607.27703) GitHub (https://github.com/IANNXANG/SpatialCLI) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27703)
在你的智能体中获取此论文:
hf papers read 2607\.27703
还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型引用此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27703 即可从本页面链接到该模型。
引用此论文的数据集 0
暂无数据集引用此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27703 即可从本页面链接到该数据集。
引用此论文的 Spaces 0
暂无 Space 引用此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27703 即可从本页面链接到该 Space。
包含此论文的收藏集 0
暂无收藏集收录此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到该收藏集。
相似文章
SpatialClaw: 重新思考智能体空间推理的动作接口
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
Spatial-Interactor: 通过与可观测物理世界的交互学习空间推理
Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。