Show-Harness:仅凭VLM代理即可控制机器人

Hugging Face Daily Papers 论文

摘要

Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。

基础视觉语言模型(VLM)展现出对世界的广泛智能,但将这种智能转化为机器人控制仍然具有挑战性。我们提出Show-Harness,一种具身接口,使VLM能够通过紧凑的语义接口将意图与动作连接起来,从而“控制”机器人。Show-Harness暴露离散的语义动作单元,VLM可以自然地对其进行推理,而具身特定的解释器则将它们确定性地转化为本地机器人动作,保持VLM直接负责细粒度的物理决策。通过相同的接口,Show-Harness展示了(1)直接解锁闭源前沿VLM进行零样本机器人控制的可行性,以及(2)仅通过几个GPU小时的微调,适应小规模开源VLM以实现低成本部署。我们进一步开发了GUMI(GUI操作接口),将相同的语义动作空间扩展到基于GUI的演示收集,允许人类和代理无需专用远程操作硬件即可跨具身“控制”机器人。大量实验表明,配备Show-Harness的VLM代理在任务、具身和环境中稳健泛化,优于代表性的代理和VLA范式。这些结果表明,正确的接口可以从基础VLM中释放出实质性的具身能力,而无需额外的模型容量或昂贵的具身特定预训练。
查看原文
查看缓存全文

缓存时间: 2026/09/10 02:13

论文页面 - Show-Harness:仅用一个VLM智能体就能操控机器人

来源:https://huggingface.co/papers/2609.10522

摘要

Show-Harness通过将视觉语言模型连接到由特定具身模块解释的离散语义动作,实现了跨机器人和图形用户界面的零样本部署以及高效的微调部署。

基础视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLMs)对世界展现出广泛的智能,但将这种智能转化为机器人控制仍然具有挑战性。我们提出了Show-Harness(https://huggingface.co/papers?q=Show-Harness),一个具身Harness(https://huggingface.co/papers?q=Embodied%20Harness),它使VLMs能够通过一个紧凑的语义接口“操控”机器人,该接口将意图与动作连接起来。Show-Harness(https://huggingface.co/papers?q=Show-Harness)暴露了离散的语义动作单元(https://huggingface.co/papers?q=semantic%20action%20units),VLMs可以自然地对其进行推理,而特定具身的解释器(https://huggingface.co/papers?q=embodiment-specific%20interpreters)则确定性地将这些单元映射为局部机器人动作,使VLM直接负责精细的物理决策。通过相同的接口,Show-Harness(https://huggingface.co/papers?q=Show-Harness)证明了(1)直接启用闭源前沿VLMs进行零样本机器人控制(https://huggingface.co/papers?q=zero-shot%20robot%20control),以及(2)仅需几小时的GPU微调即可适配小型开源VLMs进行低成本部署的可行性。我们进一步开发了GUMI(https://huggingface.co/papers?q=GUMI)(GUI操控接口(https://huggingface.co/papers?q=GUI%20Manipulation%20Interface)),将相同的语义动作空间扩展到基于GUI的示范收集,允许人类和智能体无需专业遥操作硬件即可跨不同具身形态“操控”机器人。大量实验表明,配备Show-Harness(https://huggingface.co/papers?q=Show-Harness)的VLM智能体在任务、具身形态和环境上均表现出强大的泛化能力,超越了代表性的智能体范式和VLA范式(https://huggingface.co/papers?q=VLA%20paradigms)。这些结果表明,合适的接口能够释放基础VLMs大量的具身能力,而无需额外的模型容量或昂贵的特定具身预训练。

查看arXiv页面 (https://arxiv.org/abs/2609.10522) 查看PDF (https://arxiv.org/pdf/2609.10522) 项目页面 (https://showlab.github.io/Show-Harness/) GitHub (https://github.com/showlab/Show-Harness) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.10522)

在你的智能体中获取此论文: hf papers read 2609\.10522 没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

showlab/Show-Harness-VLMs 图像-文本-转-文本 • 10分钟前更新 (https://huggingface.co/showlab/Show-Harness-VLMs)

引用此论文的数据集1

showlab/Show-Harness-Data 查看器 • 9分钟前更新 • 42.6k • 14 (https://huggingface.co/datasets/showlab/Show-Harness-Data)

引用此论文的Spaces 0

没有链接此论文的Space。 在Space的README.md中引用 arxiv.org/abs/2609.10522 以将其链接到此页面。

包含此论文的收藏集1

相似文章

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

HarnessBridge: LLM智能体的可学习双向控制器

Hugging Face Daily Papers

介绍了HarnessBridge,一种可学习的双向控制器,它将智能体-环境接口参数化,用于LLM智能体。在Terminal-Bench和SWE-bench上,它以更少的计算开销达到了与专用框架相当的性能。