面向机器人控制的上下文世界建模

Hugging Face Daily Papers 论文

摘要

本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。

现代视觉-语言-动作(VLA)模型通常难以泛化到新的设置,例如改变的相机视角或机器人形态,因为它们通常仅以当前观测和语言指令为条件。通过忽略作为变量的底层系统配置,这些模型隐含地假设了训练中遇到的固定执行上下文,从而需要对任何新环境进行数据密集型微调。在这项工作中,我们引入了上下文世界建模(ICWM),这是一个将系统识别视为上下文自适应问题的框架。ICWM使机器人策略能够从自身生成的、与任务无关的短历史交互中自主推断出必要的系统变量。与传统的使用演示来指定执行任务的上下文学习不同,ICWM利用上下文窗口来理解系统如何运作。通过在任务执行前处理这些交互,模型隐含地捕获了当前系统的世界动态,从而无需参数更新即可适应新的配置。在模拟和真实世界机器人平台上的大量实验表明,ICWM在处理新的相机视角时显著优于标准的VLA基线。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - In-Context World Modeling for Robotic Control

来源:https://huggingface.co/papers/2606.26025

摘要

ICWM 使得机器人策略能够从自身生成的交互中推断系统变量,从而无需参数更新即可适应新配置,它将系统辨识视为一个上下文内自适应问题。

现代视觉-语言-动作(VLA)模型通常无法泛化到新场景,例如改变的摄像机视角或机器人形态,因为它们通常仅以当前观测和语言指令为条件。忽略底层系统配置作为变量,这些模型隐式假设训练中遇到的固定执行上下文,导致任何新环境都需要大量数据微调。在这项工作中,我们引入了上下文内世界建模(ICWM)框架,该框架将系统辨识视为一个上下文内自适应问题。ICWM 使机器人策略能够从短暂的自生成、任务无关交互历史中自主推断关键系统变量。与使用示范来指定执行什么任务的传统上下文内学习不同,ICWM 利用上下文窗口来理解系统如何运行。通过在任务执行前处理这些交互,模型隐式捕获当前系统的世界动态,从而无需参数更新即可适应新配置。在仿真和真实机器人平台上的大量实验表明,ICWM 在新摄像机视角上显著优于标准 VLA 基线。

查看 arXiv 页面 (https://arxiv.org/abs/2606.26025)查看 PDF (https://arxiv.org/pdf/2606.26025)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.26025)

引用本文的模型 0

暂无与本文关联的模型

请在模型 README.md 中引用 arxiv.org/abs/2606.26025,以便从本页链接到它。

引用本文的数据集 0

暂无与本文关联的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2606.26025,以便从本页链接到它。

引用本文的 Spaces 0

暂无与本文关联的 Space

请在 Space README.md 中引用 arxiv.org/abs/2606.26025,以便从本页链接到它。

包含本文的收藏 0

暂无包含本文的收藏

请将本文添加到一个收藏 (https://huggingface.co/new-collection)中,以便从本页链接到它。

相似文章

World in World: 用世界模型探索世界

Hugging Face Daily Papers

本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。

机器人学习中的世界模型:全面综述

Hugging Face Daily Papers

本综述全面回顾了机器人学习中世界模型的文献,涵盖其在策略学习、规划和模拟中的作用。文章突出了预测建模在具身智能体中的关键范式、基准测试及未来发展方向。

使用潜空间世界模型预测后果并强化导航策略

arXiv cs.AI

本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。