Show-Harness:仅凭VLM代理即可控制机器人
摘要
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
查看缓存全文
缓存时间: 2026/09/10 02:13
论文页面 - Show-Harness:仅用一个VLM智能体就能操控机器人
来源:https://huggingface.co/papers/2609.10522
摘要
Show-Harness通过将视觉语言模型连接到由特定具身模块解释的离散语义动作,实现了跨机器人和图形用户界面的零样本部署以及高效的微调部署。
基础视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLMs)对世界展现出广泛的智能,但将这种智能转化为机器人控制仍然具有挑战性。我们提出了Show-Harness(https://huggingface.co/papers?q=Show-Harness),一个具身Harness(https://huggingface.co/papers?q=Embodied%20Harness),它使VLMs能够通过一个紧凑的语义接口“操控”机器人,该接口将意图与动作连接起来。Show-Harness(https://huggingface.co/papers?q=Show-Harness)暴露了离散的语义动作单元(https://huggingface.co/papers?q=semantic%20action%20units),VLMs可以自然地对其进行推理,而特定具身的解释器(https://huggingface.co/papers?q=embodiment-specific%20interpreters)则确定性地将这些单元映射为局部机器人动作,使VLM直接负责精细的物理决策。通过相同的接口,Show-Harness(https://huggingface.co/papers?q=Show-Harness)证明了(1)直接启用闭源前沿VLMs进行零样本机器人控制(https://huggingface.co/papers?q=zero-shot%20robot%20control),以及(2)仅需几小时的GPU微调即可适配小型开源VLMs进行低成本部署的可行性。我们进一步开发了GUMI(https://huggingface.co/papers?q=GUMI)(GUI操控接口(https://huggingface.co/papers?q=GUI%20Manipulation%20Interface)),将相同的语义动作空间扩展到基于GUI的示范收集,允许人类和智能体无需专业遥操作硬件即可跨不同具身形态“操控”机器人。大量实验表明,配备Show-Harness(https://huggingface.co/papers?q=Show-Harness)的VLM智能体在任务、具身形态和环境上均表现出强大的泛化能力,超越了代表性的智能体范式和VLA范式(https://huggingface.co/papers?q=VLA%20paradigms)。这些结果表明,合适的接口能够释放基础VLMs大量的具身能力,而无需额外的模型容量或昂贵的特定具身预训练。
查看arXiv页面 (https://arxiv.org/abs/2609.10522) 查看PDF (https://arxiv.org/pdf/2609.10522) 项目页面 (https://showlab.github.io/Show-Harness/) GitHub (https://github.com/showlab/Show-Harness) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.10522)
在你的智能体中获取此论文:
hf papers read 2609\.10522
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
showlab/Show-Harness-VLMs 图像-文本-转-文本 • 10分钟前更新 (https://huggingface.co/showlab/Show-Harness-VLMs)
引用此论文的数据集1
showlab/Show-Harness-Data 查看器 • 9分钟前更新 • 42.6k • 14 (https://huggingface.co/datasets/showlab/Show-Harness-Data)
引用此论文的Spaces 0
没有链接此论文的Space。 在Space的README.md中引用 arxiv.org/abs/2609.10522 以将其链接到此页面。
包含此论文的收藏集1
相似文章
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
远程代理管理器
用于远程管理和控制AI代理的工具
Harness Handbook 将智能体行为映射到代码(28分钟阅读)
Harness Handbook 为AI智能体框架提供了行为级手册,将系统行为与可验证的代码证据关联,使框架可理解、可审计、可编辑。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
HarnessBridge: LLM智能体的可学习双向控制器
介绍了HarnessBridge,一种可学习的双向控制器,它将智能体-环境接口参数化,用于LLM智能体。在Terminal-Bench和SWE-bench上,它以更少的计算开销达到了与专用框架相当的性能。