@Phoenixyin13: 英伟达的SpatialClaw新鲜出炉。 这个框架,直接可以让 VLM 在持久的 Python 环境里一步步写代码,像 Jupyter 一样慢慢来。从调用 SAM3 看东西,算深度、用 NumPy、SciPy 处理数据、实时看结果,不行就…
摘要
英伟达推出了SpatialClaw,一个基于代码的免训练代理框架,用于复杂视觉空间推理任务,在20个基准上平均达到59.9%,比之前最佳模型高11.2分。
查看缓存全文
缓存时间: 2026/06/17 20:03
英伟达的SpatialClaw新鲜出炉。
这个框架,直接可以让 VLM 在持久的 Python 环境里一步步写代码,像 Jupyter 一样慢慢来。从调用 SAM3 看东西,算深度、用 NumPy、SciPy 处理数据、实时看结果,不行就改,继续迭代,高效至极。
结果,20个空间推理基准平均 59.9%,比之前最强的 SpaceTools 高了 11.2 分,尤其是多视图、视频、4D 这种复杂任务特别棒。
“Code is the right action interface for spatial reasoning agents.”
一个真正灵活的工作台,可以给你一片新的天地,纵情发挥你的极限。
NVIDIA AI (@NVIDIAAI): Code is the right action interface for spatial reasoning agents.
New from NVIDIA Research: SpatialClaw, a training-free agent that uses code as its action interface for complex visual tasks.
Instead of calling a fixed set of pre-defined tools, the agent writes Python inside a
相似文章
@HuggingPapers: SpatialClaw NVIDIA 发布一个无需训练的空间推理智能体,以代码作为交互接口。VLM 编写 P…
NVIDIA 推出 SpatialClaw,一个无需训练的空间推理智能体,利用 VLM 在持久化内核中编写 Python 代码,组合感知工具,并修订计划,在20项基准测试中超越先前智能体 +11.2 分。
SpatialClaw: 重新思考智能体空间推理的动作接口
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。
SpatialCLI:先使用空间工具推理,再脱离工具
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
VisualClaw: 面向物理世界的实时个性化智能体
VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。
@xiaogaifun: https://x.com/xiaogaifun/status/2073771786202939572
字节Seed团队发布了EdgeBench基准测试,允许AI模型连续工作12-72小时来评估长程任务中的学习能力,发现模型从环境学习的时间和性能之间遵循log-sigmoid曲线,存在新的Scaling Law。