面向机器人控制的上下文世界建模
摘要
本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。
查看缓存全文
缓存时间: 2026/06/26 06:05
论文页面 - In-Context World Modeling for Robotic Control
来源:https://huggingface.co/papers/2606.26025
摘要
ICWM 使得机器人策略能够从自身生成的交互中推断系统变量,从而无需参数更新即可适应新配置,它将系统辨识视为一个上下文内自适应问题。
现代视觉-语言-动作(VLA)模型通常无法泛化到新场景,例如改变的摄像机视角或机器人形态,因为它们通常仅以当前观测和语言指令为条件。忽略底层系统配置作为变量,这些模型隐式假设训练中遇到的固定执行上下文,导致任何新环境都需要大量数据微调。在这项工作中,我们引入了上下文内世界建模(ICWM)框架,该框架将系统辨识视为一个上下文内自适应问题。ICWM 使机器人策略能够从短暂的自生成、任务无关交互历史中自主推断关键系统变量。与使用示范来指定执行什么任务的传统上下文内学习不同,ICWM 利用上下文窗口来理解系统如何运行。通过在任务执行前处理这些交互,模型隐式捕获当前系统的世界动态,从而无需参数更新即可适应新配置。在仿真和真实机器人平台上的大量实验表明,ICWM 在新摄像机视角上显著优于标准 VLA 基线。
查看 arXiv 页面 (https://arxiv.org/abs/2606.26025)查看 PDF (https://arxiv.org/pdf/2606.26025)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.26025)
引用本文的模型 0
暂无与本文关联的模型
请在模型 README.md 中引用 arxiv.org/abs/2606.26025,以便从本页链接到它。
引用本文的数据集 0
暂无与本文关联的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2606.26025,以便从本页链接到它。
引用本文的 Spaces 0
暂无与本文关联的 Space
请在 Space README.md 中引用 arxiv.org/abs/2606.26025,以便从本页链接到它。
包含本文的收藏 0
暂无包含本文的收藏
请将本文添加到一个收藏 (https://huggingface.co/new-collection)中,以便从本页链接到它。
相似文章
World in World: 用世界模型探索世界
本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。
WCM:一种用于视觉-语言-行动强化学习的世界评论模型
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
机器人学习中的世界模型:全面综述
本综述全面回顾了机器人学习中世界模型的文献,涵盖其在策略学习、规划和模拟中的作用。文章突出了预测建模在具身智能体中的关键范式、基准测试及未来发展方向。
使用潜空间世界模型预测后果并强化导航策略
本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。