零样本世界模型是发展高效的学习者 [R]

Reddit r/MachineLearning 论文

摘要

研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。

当今最先进的AI需要比人类幼儿多几个数量级的数据才能达到视觉能力。该论文介绍了零样本世界模型(Zero-shot World Model, ZWM),一种大幅缩小这一差距的方法。即使在仅使用单个幼儿的视觉经验进行训练的情况下,BabyZWM 也能在多种视觉认知任务上与最先进模型匹敌——且无需特定任务训练,即零样本。这项工作为从人类规模数据中实现高效灵活的学习提供了蓝图,推动了通往数据高效AI系统的路径。完整Twitter帖子:[https://x.com/khai\_loong\_aw/status/2044051456672838122?s=20](https://x.com/khai_loong_aw/status/2044051456672838122?s=20) HuggingFace:[https://huggingface.co/papers/2604.10333](https://huggingface.co/papers/2604.10333) GitHub:[https://github.com/awwkl/ZWM](https://github.com/awwkl/ZWM)
查看原文

相似文章

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

基于世界模型的Q学习

arXiv cs.LG

本文介绍了QWM,一个将世界模型与Q学习相结合的框架,通过使用想象轨迹进行动作选择来增强强化学习中的样本效率,而不影响在真实数据上的训练。在操作基准测试上,它展示了相比最先进方法的显著改进。

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。

Scaling Automatic Research Agents via World Models

arXiv cs.LG

This paper identifies a scalability bottleneck in RL-trained automatic research agents—environment execution dominates training cost—and proposes World Model RL (WMRL) with online debiasing and inverse-variance denoising to replace real execution, achieving 3–4x training speedups and better generalization.