标签
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。
提出DWM框架,该框架将潜在世界模型的转移分解为动作驱动和动作不变(世界效应)组件,在具有持久世界效应的基准上提高了规划成功率。
ABot-World-0是一个实时的、长时域交互式视频世界模型,可在单台式机GPU上运行,通过动作条件控制实现无限世界展开。
本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。
Echo-Memory 对动作条件世界模型中的记忆机制进行了受控研究,揭示了记忆结构和容量对开放域返回性能的影响显著超越回放保真度。该研究引入了一个匹配评估协议,并发现原始上下文和状态空间递归是强大的机制。
MiraBench是一个分层基准测试,用于评估机器人世界模型中的动作条件可靠性,在12种模型配置下评估物理一致性、动作跟随准确性和乐观偏差。
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。