标签
PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。
与机器人专家Rémi Cadene讨论人形机器人的挑战,涵盖灵巧性、集群学习和社会影响等话题。
对比世界模型提出了一种新方法,无需像素重建即可学习潜在动态,并通过对比目标来提高在视觉复杂环境中的鲁棒性和效率,适用于基于模型的强化学习。
这篇论文介绍了GAVEL,一个利用图世界模型来改进长期LLM机器人规划的框架,通过验证和修复动作,显著将任务成功率从41.2%提升至91.8%。
本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。
这篇文章解释了AI智能体中世界模型的概念,强调了它们在跟踪演变状态和转变方面的作用,与上下文或记忆不同,并举了叙事世界模型用于长篇小说的例子。
论文引入了视频模型中的因果可写性,表明正确的物理运动保持可用但在关键深度后变得不可编辑,这影响了训练纠正错误的方式。
机器人世界模型通过生成模拟视频来实现更快更便宜的训练,例如LTX-2.5,以使机器能够实现高级的物理导航。
Odyssey-3是一个新的基础世界模型,能够通过最少经验在机器之间重用世界知识来控制机器人、汽车、无人机和虚拟世界。
Google DeepMind 正在为其 World Models 团队招聘研究工程师和研究科学家。可通过提供的职业链接提交申请。
本文介绍CLAW,一种使用超网络生成世界模型低秩适配器的方法,能够在有限的测试时数据下实现基于模型的强化学习中的高效在线适应。
TesanaAI 推出图像到游戏功能,允许用户使用AI模型在不到5分钟内将任何游戏截图或概念转化为可玩的游戏。
作者宣布将在哈佛大学进行演讲,讨论世界模型、Le*家族,以及为何需要更多理论和数学来推进JEPAs。
本文识别并校准了物理AI中能力形成的七个非排他性来源,例如记录经验和体现耦合,采用重建性归纳设计建立一个可证伪的能力分析词汇表。
Valerant 是一个无需训练的框架,将预训练的动作条件世界模型转换为世界动作模型,用于从单张图像探索和构建 3D 游戏地图,从而减少游戏开发中的手动工作。
本文介绍了反事实隐世界模型(CLWM),用于解决世界模型中的反事实坍缩问题,通过对比目标提高部分可观测性下具身推理的规划成功率。
本文提出了一种黑盒、模型无关的方法,通过简单投影分析语言模型嵌入中的时间和地理信号,发现嵌入编码了有意义的时间顺序和空间结构,可用于可解释性和检索任务。
本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。
SyncWorld 是一个动作条件世界模型,它利用视觉校准场景来学习特定环境的动作到视觉映射,从而实现跨未见机器人环境的零样本模拟和测试时策略改进。