SpatialCLI:先使用空间工具推理,再脱离工具

Hugging Face Daily Papers 论文

摘要

SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。

视觉语言模型(VLM)越来越多地被用于具身智能体,以解释视觉输入、推理空间关系,并基于该推理做出任务级决策。然而,仍然存在根本性的能力错配:通用 VLM 可以推理整体任务,但往往错过决定成败的视觉细节;而专业视觉模型能够捕捉这些细节,却无法将其转化为任务级决策。在这项工作中,我们提出了 SpatialCLI,一个教会 VLM 使用空间工具进行推理,并逐步内化这些工具所提供的专业感知能力的框架。SpatialCLI 分为三个阶段:(1)调用(Call):将专业视觉模型作为空间工具暴露出来,以增强 VLM 的感知;(2)学习(Learn):使用冷启动 SFT 和智能体强化学习来改进工具使用;(3)内化(Internalize):将成功的工具使用轨迹进行语言化,以内化专业感知能力。我们还引入了 SpatialCLI-Bench,一个包含 516 个示例的基准,用于评估跨定位、分割、深度和姿态的组合感知能力。在 MindCube 上,SpatialCLI 将 Qwen3-VL-8B-Instruct 在使用工具时从 29.3% 提升至 84.6%,超过了使用工具的 GPT-5.6 Sol(72.1%),同时在内化后仍能在不使用工具的情况下保持 73.8% 的准确率。
查看原文
查看缓存全文

缓存时间: 2026/07/31 01:51

论文页面 - SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

来源:https://huggingface.co/papers/2607.27703

作者:, , , , , , , , , , ,

摘要

视觉语言模型(VLM)越来越多地被用于具身智能体,以解释视觉输入、推理空间关系,并基于该推理做出任务级决策。然而,一个根本性的能力错配依然存在:通用VLM能够推理整体任务,但往往会遗漏决定成败的视觉细节,而专业视觉模型能够捕捉这些细节,却无法将其转化为任务级决策。在这项工作中,我们提出了SpatialCLI,一个教会VLM使用空间工具进行推理,并逐步内化这些工具所提供的专业感知能力的框架。SpatialCLI分为三个阶段:(1)调用(Call):将专业视觉模型暴露为空间工具,以增强VLM的感知;(2)学习(Learn):使用冷启动SFT和智能体强化学习(agentic RL)来改进工具使用;(3)内化(Internalize):将成功的工具使用轨迹言语化,从而内化专业感知能力。我们进一步引入了SpatialCLI-Bench,一个包含516个示例的基准,涵盖定位、分割、深度和位姿的组合感知任务。在MindCube上,SpatialCLI将Qwen3-VL-8B-Instruct从29.3%提升至使用工具时的84.6%,超过了使用工具的GPT-5.6 Sol(72.1%),而在内化后,不使用工具时仍保持了73.8%的性能。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27703) 查看 PDF (https://arxiv.org/pdf/2607.27703) GitHub (https://github.com/IANNXANG/SpatialCLI) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27703)

在你的智能体中获取此论文:

hf papers read 2607\.27703

还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型引用此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27703 即可从本页面链接到该模型。

引用此论文的数据集 0

暂无数据集引用此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27703 即可从本页面链接到该数据集。

引用此论文的 Spaces 0

暂无 Space 引用此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27703 即可从本页面链接到该 Space。

包含此论文的收藏集 0

暂无收藏集收录此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到该收藏集。

相似文章

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。