SpatialClaw: 重新思考智能体空间推理的动作接口
摘要
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。
查看缓存全文
缓存时间: 2026/06/12 02:52
论文页面 - SpatialClaw:重新思考智能体空间推理的动作接口
来源:https://huggingface.co/papers/2606.13673
摘要
SpatialClaw 是一个无需训练的框架,采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上实现了卓越的性能。
空间推理(https://huggingface.co/papers?q=Spatial%20reasoning),即确定物体位置、相互关系以及它们在三维空间中的运动能力,仍然是视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLM)面临的根本挑战。工具增强型智能体(https://huggingface.co/papers?q=Tool-augmented%20agents)试图通过为VLM补充专业感知模块来应对这一问题,但其效果受限于调用这些工具时所使用的动作接口(https://huggingface.co/papers?q=action%20interface)。在这项工作中,我们研究了这种接口的设计如何塑造智能体进行开放域空间推理(https://huggingface.co/papers?q=spatial%20reasoning)的能力。现有的空间智能体要么采用一次性代码执行(https://huggingface.co/papers?q=code%20execution),即在观察到任何中间结果之前就确定完整的分析策略,要么依赖结构化的工具调用接口,这种接口通常缺乏自由组合操作或为每个任务定制分析的灵活性。这两种设计都为开放、复杂的三维/四维空间推理(https://huggingface.co/papers?q=3D%2F4D%20spatial%20reasoning)提供了有限的灵活性。因此,我们提出了 SpatialClaw,一种用于空间推理(https://huggingface.co/papers?q=spatial%20reasoning)的无需训练框架,该框架采用代码作为动作接口(https://huggingface.co/papers?q=action%20interface)。SpatialClaw 维护了一个有状态的 Python 内核(https://huggingface.co/papers?q=Python%20kernel),其中预加载了输入帧和一系列感知与几何基元(https://huggingface.co/papers?q=geometry%20primitives),使得基于VLM的智能体能够根据所有先前输出,每步编写一个可执行的代码单元,从而让智能体能够灵活地组合和操控感知结果,并根据中间文本和视觉观察以及每个问题的需求调整其分析。在跨越广泛静态和动态三维/四维空间推理(https://huggingface.co/papers?q=3D%2F4D%20spatial%20reasoning)任务的20个空间推理(https://huggingface.co/papers?q=spatial%20reasoning)基准测试(https://huggingface.co/papers?q=benchmarks)上进行评估,SpatialClaw 实现了59.9%的平均准确率,比最近的空间智能体提升了+11.2个百分点,并且在来自两个模型家族的六个VLM骨干网络(https://huggingface.co/papers?q=VLM%20backbones)上取得了一致的性能提升,无需任何基准或模型特定的适配。
查看 arXiv 页面(https://arxiv.org/abs/2606.13673)查看 PDF(https://arxiv.org/pdf/2606.13673)项目页面(https://spatialclaw.github.io/)GitHub6(https://github.com/NVlabs/SpatialClaw)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13673)
在您的智能体中获取这篇论文:
hf papers read 2606\.13673
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.13673 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.13673 以从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.13673 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将这篇论文添加到收藏集(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
@HuggingPapers: SpatialClaw NVIDIA 发布一个无需训练的空间推理智能体,以代码作为交互接口。VLM 编写 P…
NVIDIA 推出 SpatialClaw,一个无需训练的空间推理智能体,利用 VLM 在持久化内核中编写 Python 代码,组合感知工具,并修订计划,在20项基准测试中超越先前智能体 +11.2 分。
SpatialCLI:先使用空间工具推理,再脱离工具
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
RS-Claw: 通过层次化技能树实现的渐进式主动工具探索——面向遥感智能体
RS-Claw 提出了一种用于遥感智能体的主动工具探索范式,利用层次化技能树,支持按需顺序决策,在Earth-Bench上实现了高达86%的输入令牌压缩,并且性能优于被动选择基线。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。