基于VLM智能体的上下文机器人学习

Hugging Face Daily Papers 论文

摘要

本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。

使机器人能够像人类一样轻松地适应陌生环境,仍然是具身智能的一个远大目标。没有有限数量的演示能涵盖机器人将遇到的每种任务和情况,这使得在部署时从上下文学习的能力对于泛化至关重要。然而,这种上下文学习(ICL)在很大程度上仍超出现有机器人策略的能力范围。商业视觉语言模型(VLMs)的广泛智能体能力,如GPT-6 Astra,提出了一个引人入胜的问题:这些模型能否从演示、示例和交互反馈中学习,然后在没有梯度更新或对任务特定参数的持续更改的情况下,将这些信息转化为从新初始状态出发的可执行和可验证的机器人行为?我们介绍了GPT-Policy,一个用于上下文机器人学习的通用智能体框架。GPT-Policy集成了一个上下文编译器,用于保留任务相关的视觉转换,一个VLM用于提议机器人-工具动作,以及一个约束控制器,用于验证和执行每个动作并报告其结果。我们通过任务成功和效率指标、跨模型的匹配比较以及受控上下文消融实验来评估其可靠性和局限性。在真实机器人试验中,即使没有机器人动作标签,人类视频演示也能提高任务完成率,而对齐的动作引用在接触敏感任务上产生进一步提升。这些发现将GPT-Policy定位为通过上下文学习实现机器人适应性的一步,为将VLM的通用能力转化为物理行为提供了经验基础,并阐明了可靠部署必须克服的挑战。
查看原文
查看缓存全文

缓存时间: 2026/09/17 14:54

论文页面 - 基于视觉语言模型智能体的上下文机器人学习

来源:https://huggingface.co/papers/2609.19138
作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

让机器人像人类一样适应陌生环境仍然是具身人工智能的一个远大目标。有限数量的演示无法覆盖机器人可能遇到的每项任务和情况,因此在部署时能够从上下文中学习对于泛化能力至关重要。然而,这种上下文学习(ICL)在很大程度上超出了现有机器人策略的能力范围。商业视觉语言模型(VLM)广泛的人工智能能力,例如 GPT-6Astra,提出了一个引人注目的问题:这些模型能否从演示、示例和交互反馈中学习,然后将这些信息转化为可执行且可验证的机器人行为——从新的初始状态开始,无需梯度更新或对特定任务参数的持久性更改?

我们推出了 GPT-Policy,这是一个用于上下文机器人学习的通用智能体框架。GPT-Policy 集成了一个保留任务相关视觉转变的上下文编译器、一个提出机器人工具动作的视觉语言模型,以及一个验证并执行每个动作并报告其结果的约束控制器。我们通过任务成功率和效率指标、跨模型的匹配比较以及受控的上下文消融实验,评估了其可靠性和局限性。在真实机器人实验中,即使没有机器人动作标签,人类视频演示也能提高任务完成率;而对齐的动作参考则在接触敏感任务上带来了进一步的提升。这些发现将 GPT-Policy 定位为通过上下文学习实现机器人适应的一步,为将 VLM 的通用能力转化为物理行为提供了实证基础,并阐明了为实现可靠部署所必须克服的挑战。

查看 arXiv 页面 (https://arxiv.org/abs/2609.19138)查看 PDF (https://arxiv.org/pdf/2609.19138)项目页面 (https://cheng-haha.github.io/GPT-Policy/)GitHub178 (https://github.com/cheng-haha/GPT-Policy)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.19138)

在您的智能体中获取本文:

hf papers read 2609\.19138

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2609.19138 以从本页面链接它。

引用本文的数据集0

没有数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2609.19138 以从本页面链接它。

引用本文的 Spaces0

没有 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2609.19138 以从本页面链接它。

包含本文的收藏夹0

没有收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

面向机器人控制的上下文世界建模

Hugging Face Daily Papers

本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。

EXIMO:VLM引导的VLA策略探索

Hugging Face Daily Papers

EXIMO 提出了一种高效的算法,用于微调VLA机器人策略,采用三阶段流程:VLM引导探索、模仿学习和残差强化学习,展示了样本效率和性能的提升。