标签
Introduces Quantum-Structured World Models (QSWMs), a quantum-inspired framework for predictive world modeling with structured latent states, and evaluates them on elementary cellular automata against classical baselines.
SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。
本文介绍了MASS,一种多玩家世界模型方法,通过使用权威共享状态将世界动态与视图渲染解耦,从而实现可扩展且一致的多智能体模拟,支持多达1,024个并发玩家。
一条推文评论说,谷歌需要在前沿编码方面迎头赶上才能保持竞争力,而Demis Hassabis则专注于基础研究,比如用于长期目标的世界模型。
Wayve 宣布推出 GAIA-4,这是一个多模态世界模型,为端到端自动驾驶模型的安全关键评估提供闭环仿真支持,能够对骑行者和行人的交互进行反事实回放。
这篇预印本介绍了用于音乐共创代理的分层自监督世界模型,具有对CPU友好的快速模型,以及用于MIDI修补和生成的实时演示。
WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。
WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。
介绍了DENSEWORLD,一个包含1000小时拥挤的全球南方城市场景的数据集,以及FactorJEPA,一种将未来预测分解为布局、智能体和交互的JEPA变体,在遮挡和异质性条件下提高了准确性和鲁棒性。
本文提出SG-WAM,一种自引导框架,用于直接在策略派生的表示空间中学习几何感知的、以动作为条件的世界模型。它在LIBERO和LIBERO-Plus基准测试上取得了最先进的成功率,在真实世界评估中超越了强基线。
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
本文提出QQWorld,一种分位数-分位数匹配目标,替代LeWorldModel中的Epps-Pulley目标,以更好地正则化潜在分布,提升控制环境中的规划成功率。
NVIDIA 发布了 cosmos-framework,这是一个端到端的开源框架,用于训练和提供世界模型(包括 Cosmos3 模型家族),支持分布式训练和推理,并兼容多种后端。
提出时序距离JEPA(TD-JEPA),从离线轨迹中挖掘有向时序代价,以改进潜在世界模型预测控制,在机器人环境中实现了更高的成功率。
VisualPatchWorld 提出了一种将世界动力学学习为代码的方法,能够从数据中构建可检查和可编辑的模拟器。在导航和操作任务中,它实现了强大的规划成功率。
INTACT 是一个端到端的统一 JEPA,直接学习意图到动作的映射,从而实现无搜索的世界模型控制。它在四个视觉控制任务上实现了 95.33% 的直接宏观成功率,测试时零搜索,规划延迟降低约 300 倍。
NVIDIA推出Cosmos-H-Dreams,这是一个实时动作条件生成式模拟器,专为手术机器人设计,是从更大的Cosmos-H-Surgical-Simulator中提炼而来。它使用FlashDreams推理库,在单张RTX PRO 6000 GPU上运行,支持用于训练和评估的交互式闭环控制。
本文通过使用Moving-MNIST、Pendulum、CartPole和KTH Actions上的扩张代理,实证研究了多时间尺度潜在一致性如何影响世界模型中的转移几何。研究发现,软一致性可以推动被动视频动态趋向收缩,但在动作条件领域则不成立。
对 Yann LeCun 赌注的分析,他认为智能始于通过 JEPA 构建的世界模型,而非语言。此举得到 AMI Labs 10.3 亿美元资金支持。本文解释了为何像素预测会失败,以及 JEPA 如何在潜在空间中进行预测以避免模糊的未来。