@yingwww_: 温暖提示:你的世界模型永远不应该停止学习。介绍AdaJEPA,一个自适应的世界模型,可以规划、行动和适应……
摘要
AdaJEPA引入了一种自适应的潜在世界模型,该模型在测试期间通过闭环模型预测控制持续更新,显著提高了分布偏移下的规划成功率。
查看缓存全文
缓存时间: 2026/07/05 10:31
温暖提示:你的世界模型永远不应该停止学习
介绍 AdaJEPA,一种自适应世界模型,在闭环中执行规划、行动和适应。每一步行动都会带来新的观察,每一次状态转换都会优化隐式表示和预测。
📝: https://t.co/85WWwn5QDS https://t.co/kC8E0TO6aW
AdaJEPA:一种自适应隐式世界模型 | 智能学习AI实验室
来源:https://agenticlearning.ai/adajepa/
王颖 (https://agenticlearning.ai/people/ying-wang/)1,2, Oumayma Bounou1, Yann LeCun (http://yann.lecun.com/)1,2*, 以及 任梦野 (https://agenticlearning.ai/people/mengye-ren/)1*
1纽约大学, 2AMI 实验室 *共同指导
CoRR
**概要:**AdaJEPA 在闭环模型预测控制内部自适应一个隐式世界模型,利用每一次观察到的状态转换作为下一次重新规划前的自监督信号。
摘要
隐式世界模型通过在紧凑的隐空间内预测未来状态,使得从高维观测中进行规划成为可能。然而,这些模型通常在测试时保持冻结:当预测变得不准确时,规划可能会失败,尤其是在测试时分布偏移的情况下。为了解决这个问题,我们提出了 AdaJEPA,一种自适应隐式世界模型,在模型预测控制 (MPC) 的闭环内执行测试时自适应。训练完成后,AdaJEPA 规划并执行第一个动作块,将观察到的下一状态转换作为自监督自适应信号,并用更新后的模型重新规划。这种闭环更新持续重新校准世界模型,无需额外的专家演示。在一系列目标到达任务中,AdaJEPA 在每次 MPC 重新规划步骤中仅需一个梯度步,就能显著提高规划成功率。
目录:概述 (https://agenticlearning.ai/adajepa/#overview)方法 (https://agenticlearning.ai/adajepa/#method)结果 (https://agenticlearning.ai/adajepa/#results)可视化 (https://agenticlearning.ai/adajepa/#visualization)要点 (https://agenticlearning.ai/adajepa/#takeaways)## 概述
AdaJEPA 执行一个闭环的规划-行动-适应-重新规划循环。在每一步 MPC 中,智能体使用当前世界模型进行规划,执行第一个动作,观察下一个状态转换,利用隐式预测误差更新模型,并使用自适应后的模型重新规划。
隐式世界模型通过在紧凑的表示空间中预测未来状态,使得从高维观测中进行规划变得可行。然而,世界模型通常在训练后保持冻结。不准确的预测,尤其是在测试分布偏移下情况严重时,可能使 MPC 针对错误的想象未来优化动作,从而阻碍规划。
AdaJEPA 通过在部署期间自适应世界模型来解决这个问题。MPC 执行的每个动作都会产生一个新的转换 (o_t, a_t, o_{t+1}),这成为下一次重新规划前的自监督训练信号。这在简单的循环中耦合了学习和规划:规划、行动、适应、重新规划。
方法
AdaJEPA 从一个预训练的 JEPA 世界模型开始,该模型包含一个感官编码器 \mathcal{E}^s_\phi、一个动作编码器 \mathcal{E}^a_\psi 和一个隐式预测器 f_\theta。给定一个目标观测 o_g,MPC 通过在隐空间中进行预测器展开并最小化到目标表示 z_g = \mathcal{E}^s_\phi(o_g) 的距离来进行规划:
a^*_{t:t+H-1} = \arg\min_{a_{t:t+H-1}} \sum_{k=1}^{H} \alpha_k\, d(\hat z_{t+k}, z_g). 执行第一个动作后,AdaJEPA 将观察到的转换存储在一个小型在线缓冲区中,并通过最小化隐式预测目标来自适应模型:
\mathcal{L}_{\rm ada}(\mathcal{B}) = \frac{1}{|\mathcal{B}|} \sum_{(o_i,a_i,o_{i+1})\in\mathcal{B}} \ell\!\left( f_\theta\!\left(z_i,\mathcal{E}^a_\psi(a_i)\right), \operatorname{sg}(z_{i+1}) \right). 我们提出的自适应非常轻量:默认情况下,每次 MPC 重新规划使用一个梯度步,一个包含最近五个转换的回放缓冲区,并且只更新视觉编码器和预测器的最后几层。有关自适应目标、学习率、更新步骤和缓冲区选择的替代方案,请参见论文中的消融实验。
AdaJEPA 闭环规划与自适应算法。AdaJEPA 闭环规划与自适应算法。
结果
AdaJEPA 在分布内和分布外设置中都改进了规划。对于分布内环境,当冻结模型次优时,AdaJEPA 提高了性能,并在冻结模型已经接近最优时保持强基线。在分布偏移下,AdaJEPA 提供了一致的增益,因为每个观察到的转换都有助于在下一次重新规划前重新校准模型。
形状偏移改变 PushObj 中的形状;星形标记保留的物体形状。形状偏移改变 PushObj 中的形状;星形标记保留的物体形状。
视觉偏移使用模糊、椒盐噪声、暗光照和颜色变化破坏 PushT 观测。视觉偏移使用模糊、椒盐噪声、暗光照和颜色变化破坏 PushT 观测。
在 PushObj 形状偏移和 PushT 视觉偏移中,自适应通过将隐式世界模型重新校准到测试时遇到的物体或观测流,从而改进规划。
动力学偏移改变 PointMaze 物理特性;布局偏移测试保留的迷宫布局。动力学偏移改变 PointMaze 物理特性;布局偏移测试保留的迷宫布局。
在 PointMaze 动力学偏移上,冻结模型已经很强,可能是因为三帧历史为其提供了对当前动力学的一些上下文学习能力。AdaJEPA 通过从观察到的转换中更新世界模型,进一步提升了这一基线。在未见布局上,自适应提高了成功率,并使轨迹更接近最短路径。
训练数据规模改变 PushObj 的形状多样性 K 和每种形状的轨迹数量 N。训练数据规模改变 PushObj 的形状多样性 K 和每种形状的轨迹数量 N。
数据缩放改善了冻结模型和自适应模型,但当离线数据有限时,测试时自适应尤其有价值。在低数据量的已知形状上,AdaJEPA 可以将冻结模型的成功率提高一倍以上,甚至超过使用更多数据训练的冻结模型。
可视化
这些示例说明了自适应如何带来更好的预测和规划。蓝色表示冻结模型,红色表示 AdaJEPA。星形 (★) 标记未见的测试形状或配置,即使解码后的展开仍能合理重建并保留训练域结构。尽管解码器在默认数据训练后保持冻结,但在轻量级测试时自适应后,它仍然能产生有意义的展开。这表明 AdaJEPA 通过利用共享的隐式结构和重新校准预测来改进规划,同时保持接近学习到的隐式流形。
示例 1: PushObj +, 冻结。示例 1: PushObj +, AdaJEPA。示例 2: PushObj I★, 冻结。示例 2: PushObj I★, AdaJEPA。示例 3: PushT 模糊★, 冻结。示例 3: PushT 模糊★, AdaJEPA。示例 4: PushT 红色★, 冻结。示例 4: PushT 红色★, AdaJEPA。
要点
AdaJEPA 表明,世界模型应该在部署期间继续学习,而不是在训练后保持冻结。通过从规划与行动过程中遇到的转换中改进预测,自适应世界模型可以支持在不断变化的世界中更具弹性的感知和规划。
BibTeX
@misc{wang2026adajepaadaptivelatentworld, title={AdaJEPA: An Adaptive Latent World Model}, author={Ying Wang and Oumayma Bounou and Yann LeCun and Mengye Ren}, year={2026}, eprint={2606.32026}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2606.32026}, }
相似文章
@mengyer: 新研究:AdaJEPA在闭环中感知、规划并自适应。它始终在学习!
介绍了AdaJEPA,一个自适应世界模型,通过感知、规划和行动在闭环中持续学习。
@LiorOnAI:大多数支撑智能体的模型在运行时并不学习。你训练它们,冻结权重,然后部署。每次……
介绍了AdaJEPA,一种自适应世界模型,在部署期间持续学习并更新其潜在表征,使智能体能够根据真实世界观测调整计划,无需重新训练或记忆技巧。
时序距离JEPA:面向潜在世界模型预测控制的规划感知表示学习
提出时序距离JEPA(TD-JEPA),从离线轨迹中挖掘有向时序代价,以改进潜在世界模型预测控制,在机器人环境中实现了更高的成功率。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
用动作条件预测一致性诊断JEPA世界模型
提出动作条件预测一致性(ACPC),这是一种JEPA世界模型的诊断方法,用于衡量在动作条件展开中干净观测与扰动观测如何发散,并为预测误差和规划器成本提供理论界限。在多个视觉控制任务上的实验验证了该诊断在LeWM和PLDM等模型上的有效性。