零样本世界模型是发展高效的学习者 [R]
摘要
研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。
相似文章
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
基于世界模型的Q学习
本文介绍了QWM,一个将世界模型与Q学习相结合的框架,通过使用想象轨迹进行动作选择来增强强化学习中的样本效率,而不影响在真实数据上的训练。在操作基准测试上,它展示了相比最先进方法的显著改进。
以对象为中心的残差强化学习用于零样本Sim-to-Real VLA增强
一个以对象为中心的残差强化学习框架提升了视觉-语言-动作模型的零样本模拟到真实迁移能力,在无需真实世界训练的情况下,将操作任务的成功率从42%提高到76%。
通过残差潜在动作学习基于视觉特征的世界模型
本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。
Scaling Automatic Research Agents via World Models
This paper identifies a scalability bottleneck in RL-trained automatic research agents—environment execution dominates training cost—and proposes World Model RL (WMRL) with online debiasing and inverse-variance denoising to replace real execution, achieving 3–4x training speedups and better generalization.