@Phoenixyin13: 英伟达的SpatialClaw新鲜出炉。 这个框架,直接可以让 VLM 在持久的 Python 环境里一步步写代码,像 Jupyter 一样慢慢来。从调用 SAM3 看东西,算深度、用 NumPy、SciPy 处理数据、实时看结果,不行就…

X AI KOLs Timeline 论文

摘要

英伟达推出了SpatialClaw,一个基于代码的免训练代理框架,用于复杂视觉空间推理任务,在20个基准上平均达到59.9%,比之前最佳模型高11.2分。

英伟达的SpatialClaw新鲜出炉。 这个框架,直接可以让 VLM 在持久的 Python 环境里一步步写代码,像 Jupyter 一样慢慢来。从调用 SAM3 看东西,算深度、用 NumPy、SciPy 处理数据、实时看结果,不行就改,继续迭代,高效至极。 结果,20个空间推理基准平均 59.9%,比之前最强的 SpaceTools 高了 11.2 分,尤其是多视图、视频、4D 这种复杂任务特别棒。 “Code is the right action interface for spatial reasoning agents.” 一个真正灵活的工作台,可以给你一片新的天地,纵情发挥你的极限。
查看原文
查看缓存全文

缓存时间: 2026/06/17 20:03

英伟达的SpatialClaw新鲜出炉。

这个框架,直接可以让 VLM 在持久的 Python 环境里一步步写代码,像 Jupyter 一样慢慢来。从调用 SAM3 看东西,算深度、用 NumPy、SciPy 处理数据、实时看结果,不行就改,继续迭代,高效至极。

结果,20个空间推理基准平均 59.9%,比之前最强的 SpaceTools 高了 11.2 分,尤其是多视图、视频、4D 这种复杂任务特别棒。

“Code is the right action interface for spatial reasoning agents.”

一个真正灵活的工作台,可以给你一片新的天地,纵情发挥你的极限。

NVIDIA AI (@NVIDIAAI): Code is the right action interface for spatial reasoning agents.

New from NVIDIA Research: SpatialClaw, a training-free agent that uses code as its action interface for complex visual tasks.

Instead of calling a fixed set of pre-defined tools, the agent writes Python inside a

相似文章

SpatialCLI:先使用空间工具推理,再脱离工具

Hugging Face Daily Papers

SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。