基于VLM智能体的上下文机器人学习
摘要
本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。
查看缓存全文
缓存时间: 2026/09/17 14:54
论文页面 - 基于视觉语言模型智能体的上下文机器人学习
来源:https://huggingface.co/papers/2609.19138
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
让机器人像人类一样适应陌生环境仍然是具身人工智能的一个远大目标。有限数量的演示无法覆盖机器人可能遇到的每项任务和情况,因此在部署时能够从上下文中学习对于泛化能力至关重要。然而,这种上下文学习(ICL)在很大程度上超出了现有机器人策略的能力范围。商业视觉语言模型(VLM)广泛的人工智能能力,例如 GPT-6Astra,提出了一个引人注目的问题:这些模型能否从演示、示例和交互反馈中学习,然后将这些信息转化为可执行且可验证的机器人行为——从新的初始状态开始,无需梯度更新或对特定任务参数的持久性更改?
我们推出了 GPT-Policy,这是一个用于上下文机器人学习的通用智能体框架。GPT-Policy 集成了一个保留任务相关视觉转变的上下文编译器、一个提出机器人工具动作的视觉语言模型,以及一个验证并执行每个动作并报告其结果的约束控制器。我们通过任务成功率和效率指标、跨模型的匹配比较以及受控的上下文消融实验,评估了其可靠性和局限性。在真实机器人实验中,即使没有机器人动作标签,人类视频演示也能提高任务完成率;而对齐的动作参考则在接触敏感任务上带来了进一步的提升。这些发现将 GPT-Policy 定位为通过上下文学习实现机器人适应的一步,为将 VLM 的通用能力转化为物理行为提供了实证基础,并阐明了为实现可靠部署所必须克服的挑战。
查看 arXiv 页面 (https://arxiv.org/abs/2609.19138)查看 PDF (https://arxiv.org/pdf/2609.19138)项目页面 (https://cheng-haha.github.io/GPT-Policy/)GitHub178 (https://github.com/cheng-haha/GPT-Policy)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.19138)
在您的智能体中获取本文:
hf papers read 2609\.19138
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.19138 以从本页面链接它。
引用本文的数据集0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.19138 以从本页面链接它。
引用本文的 Spaces0
没有 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.19138 以从本页面链接它。
包含本文的收藏夹0
没有收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略
RoboTALES引入了一个两阶段框架,结合基于LLM的规划和基于VLM的批评,以改进任务对齐的视频生成和机器人策略训练,在长时域操作任务上显著优于现有方法。
面向机器人控制的上下文世界建模
本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。
GaP:一种面向变体自动化任务的图即策略多智能体自学习框架
引入图即策略(GaP),一种多智能体编码框架,通过模块化机器人技能库生成有向计算图,并利用并行模拟迭代优化任务执行,在变体自动化任务上成功率显著高于基准方法。
Hy-Embodied-0.5-VLA: 从视觉-语言-动作模型到真实世界机器人学习栈
HyVLA-0.5 是一个端到端机器人学习系统,整合了数据收集、模型设计、预训练、微调和强化学习,用于真实世界部署。
EXIMO:VLM引导的VLA策略探索
EXIMO 提出了一种高效的算法,用于微调VLA机器人策略,采用三阶段流程:VLM引导探索、模仿学习和残差强化学习,展示了样本效率和性能的提升。