@HuggingPapers: SpatialClaw NVIDIA 发布一个无需训练的空间推理智能体,以代码作为交互接口。VLM 编写 P…

X AI KOLs Following 论文

摘要

NVIDIA 推出 SpatialClaw,一个无需训练的空间推理智能体,利用 VLM 在持久化内核中编写 Python 代码,组合感知工具,并修订计划,在20项基准测试中超越先前智能体 +11.2 分。

SpatialClaw NVIDIA 发布一个无需训练的空间推理智能体,以代码作为交互接口。VLM 在持久化内核中编写 Python 代码,组合感知工具,检查结果,并修订计划——无需微调。在20项基准测试中超越先前智能体 +11.2 分 https://t.co/MJH98obV52
查看原文
查看缓存全文

缓存时间: 2026/06/17 19:58

SpatialClaw

NVIDIA 推出了一款无需训练的空间推理智能体,将代码作为其动作交互界面。视觉语言模型(VLM)在持久化内核中编写 Python 代码,组合感知工具,检查结果,并修订计划——完全无需微调。在 20 个基准测试中较此前智能体提升 +11.2 分。https://t.co/MJH98obV52

相似文章

@dair_ai: https://x.com/dair_ai/status/2068724104815890889

X AI KOLs Following

重点介绍近期三篇AI论文:SpatialClaw(通过代码实现无需训练的空间推理),SkillWeaver(组合式技能路由,采用分解-检索-组合流水线),以及PreAct(将智能体运行编译为快速状态机,用于重复任务)。

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。