Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型

arXiv cs.AI 论文

摘要

Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。

arXiv:2606.31232v1 Announce Type: new 摘要:学习用于规划的视觉世界模型需要紧凑且对动作保持敏感的潜在动力学,然而无重建的联合嵌入目标可能会导致对动作不敏感的表示崩溃。我们提出 Delta-JEPA,一种端到端的无重建世界模型,它通过潜在差异动作解码器(LDAD)增强潜在前向预测。与从拼接端点嵌入推断动作的逆解码器不同,LDAD 从连续观测之间的潜在位移重建执行的动作。这种位移级监督直接正则化转移几何:相邻嵌入无法在不丢失动作信息的情况下崩溃,并且鼓励不同动作在基于展开的规划中诱发可区分的潜在变化。Delta-JEPA 仅使用潜在预测和动作重建,避免像素重建和分布匹配正则化。在四个视觉连续控制任务上,Delta-JEPA 相比基于 JEPA 和表示学习的基线世界模型提升了规划性能。消融实验表明,基于位移的动作解码始终比端点拼接更有效,且动作敏感性分析显示出更清晰的动作条件潜在响应。这些结果表明,监督潜在差异是一种简单且有效的机制,用于学习抗崩溃且动作敏感的世界模型。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:37

# Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
来源:https://arxiv.org/html/2606.31232
张正浩¹,王远翔¹,关振宇¹¹¹¹footnotemark:1,杨雨佳¹¹¹¹footnotemark:1,史炳康²¹¹¹footnotemark:1,宗天宇¹,易鸿志¹,晁国庆³,陈兴辰⁴,杨天坤¹,鲍晨曦¹,余涛⁵,周晶晶¹,徐俊刚¹

###### 摘要

学习用于规划的视觉世界模型,需要紧凑且对动作敏感的潜在动力学,然而免重构的联合嵌入目标可能坍缩为对动作不敏感的表示。我们提出Delta-JEPA,一种端到端的免重构世界模型,它通过潜在差异动作解码器(LDAD)增强潜在前向预测。与从拼接的端点嵌入推断动作的逆解码器不同,LDAD从连续观测之间的潜在位移中重建执行的动作。这种位移级监督直接正则化了转移几何:相邻嵌入在不丢失动作信息的情况下无法坍缩,并且不同的动作被鼓励引发可区分的潜在变化,以用于基于展开的规划。Delta-JEPA仅使用潜在预测和动作重建,避免了像素重建和分布匹配正则化器。在四个视觉连续控制任务中,Delta-JEPA相比基于JEPA和表示学习的基准世界模型,改进了规划性能。消融实验表明,基于位移的动作解码始终比端点拼接更有效,且动作敏感性分析显示出更清晰的动作条件潜在响应。这些结果表明,监督潜在差异是一种简单有效的机制,用于学习抗坍缩且对动作敏感的世界模型。

## 引言

构建能够根据原始感官观测推断环境动态并预测未来状态的智能体,仍然是人工智能的核心目标 (Ha and Schmidhuber2018a (https://arxiv.org/html/2606.31232#bib.bib4),b (https://arxiv.org/html/2606.31232#bib.bib5))。世界模型通过学习一个内部的“想象空间”来实现这一目标,在这个空间中,可以在候选动作下预测未来结果,从而支持规划和控制 (Hafneret al.2019a (https://arxiv.org/html/2606.31232#bib.bib6); Wuet al.2023 (https://arxiv.org/html/2606.31232#bib.bib7))。早期的世界模型通常依赖于像素空间重建 (Hafneret al.2019b (https://arxiv.org/html/2606.31232#bib.bib8)),但重建高维观测在计算上代价高昂,并且可能将模型能力浪费在对动态无关紧要但视觉上细节丰富的信息上 (Assranet al.2023 (https://arxiv.org/html/2606.31232#bib.bib9),2025 (https://arxiv.org/html/2606.31232#bib.bib10); Hauri and Zenke2026 (https://arxiv.org/html/2606.31232#bib.bib11))。这使得免重构的潜在预测成为一种有吸引力的替代方案。

联合嵌入预测架构(JEPA)(Assranet al.2023 (https://arxiv.org/html/2606.31232#bib.bib9)) 为潜在世界建模提供了一个特别有吸引力的基础,因为它们直接预测紧凑的未来表示,而不是未来像素。然而,这种效率引入了一个重大挑战:当仅通过潜在预测目标进行端到端训练时,基于JEPA的世界模型很容易坍缩为平凡的常数表示 (Maeset al.2026 (https://arxiv.org/html/2606.31232#bib.bib2))。在这种情况下,模型实现了看似很低的预测损失,同时破坏了规划所需的表示结构。

现有的方法通常通过额外的训练启发式来解决坍缩问题,尽管这些设计涉及不同的权衡。例如,LeWorldModel (Maeset al.2026 (https://arxiv.org/html/2606.31232#bib.bib2)) 使用SigReg (Balestriero and LeCun2025 (https://arxiv.org/html/2606.31232#bib.bib13)) 来稳定端到端的潜在预测,但它并未明确约束潜在空间对执行的动作敏感,从而允许不同的动作引发弱可区分的潜在转移。PLDM (Sobalet al.2026 (https://arxiv.org/html/2606.31232#bib.bib14)) 则将VICReg风格的正则化与逆动态相结合,产生了一个更复杂的多损失目标,对超参数调优敏感。此外,其逆动态模块从拼接的相邻潜在状态 [z_t, z_{t+1}] 解码动作。由于前向预测器本身是以执行动作为条件的,端到端优化可以使得下一个状态表示 z_{t+1} 吸收容易被逆解码器利用的动作相关线索,而不需要模型表示两个状态之间的实际转移。

为了解决这些问题,我们提出Delta-JEPA,一种基于潜在差异动作解码器(LDAD)的端到端潜在世界模型。与从拼接的潜在状态重建动作不同,LDAD 从潜在差异 Δz_t = z_{t+1} - z_t 预测执行的动作。这种位移级逆目标鼓励对规划至关重要的动作敏感潜在动态:如果同一潜在状态下的不同动作导致无法区分的下一个嵌入,世界模型就无法表示动作可控的下一个状态转移,使得潜在展开对规划无用。相反,当同一状态下的不同动作引发可区分的下一个状态嵌入时,潜在表示更具可控性。通过要求从 Δz_t 恢复动作,LDAD 鼓励不同的动作引发可区分的潜在位移和下一个状态嵌入,同时阻止动作预测依赖于状态特定线索而非转移本身。

Delta-JEPA 通过一个简单的双目标方案训练这一机制:潜在前向预测在动作下建模未来表示,而 LDAD 使动作引起的潜在位移对其动作具有预测性。这一设计对于规划尤为重要,因为候选动作序列通过潜在展开进行评估,模型必须区分替代动作如何驱动环境前进。实验上,我们展示了 Delta-JEPA 在多样化的连续控制任务中提升了规划性能,并学习了更动作敏感的潜在转移结构。

本文的主要贡献总结如下:

- • 动作敏感潜在动态:我们引入 LDAD,一种基于位移的逆目标,通过强制动作可区分的潜在转移来缓解坍缩。
- • 双目标训练框架:我们开发了 Delta-JEPA,一种仅通过潜在前向预测和基于 LDAD 的动作重建进行训练的端到端潜在世界模型。
- • 实证验证:我们在多样化的连续控制任务上评估 Delta-JEPA,展示了改进的规划性能以及更强的动作敏感潜在动态。

## 相关工作

### 潜在世界模型

世界模型学习环境动态的紧凑预测模型,支持从高维观测中进行规划和控制 (Ha and Schmidhuber2018b (https://arxiv.org/html/2606.31232#bib.bib5),a (https://arxiv.org/html/2606.31232#bib.bib4))。一条突出的工作路线是为视觉控制构建潜在动态模型,包括 PlaNet (Hafneret al.2019b (https://arxiv.org/html/2606.31232#bib.bib8))、Dreamer (Hafneret al.2019a (https://arxiv.org/html/2606.31232#bib.bib6)) 和 DreamerV3 (Hafneret al.2023 (https://arxiv.org/html/2606.31232#bib.bib15)),它们将像素编码为潜在状态,并使用想象展开进行规划或策略学习。这些方法证明了潜在想象的有效性,但它们通常依赖于重建或奖励驱动的目标。这推动了免重构潜在世界模型的发展,这些模型直接预测紧凑表示,并将模型能力集中在控制相关的状态变化上。

### 联合嵌入预测架构

联合嵌入预测架构(JEPA)被提出作为非生成式预测模型,在表示空间而非输入空间中进行预测比较 (LeCun and others2022 (https://arxiv.org/html/2606.31232#bib.bib16))。I-JEPA 为图像实例化了这一思想,通过上下文嵌入预测被遮罩的目标嵌入 (Assranet al.2023 (https://arxiv.org/html/2606.31232#bib.bib9)),而 V-JEPA 将特征预测扩展到视频,并在没有标签、文本监督或像素重建的情况下学习时空表示 (Bardeset al.2024 (https://arxiv.org/html/2606.31232#bib.bib17))。对于世界模型学习,JEPA 具有吸引力,因为规划需要准确预测不同动作如何导致不同的未来状态,而非逼真的观测合成。然而,仅使用潜在预测损失进行端到端 JEPA 训练可能产生平凡的常数表示,使得防坍缩成为一个核心设计问题。

### 坍缩预防与逆动态

最近的基于JEPA的世界模型引入了额外的约束来避免特征坍缩。DINO-WM (Zhouet al.2025 (https://arxiv.org/html/2606.31232#bib.bib1)) 通过使用冻结的 DINOv2 视觉特征 (Oquabet al.2023 (https://arxiv.org/html/2606.31232#bib.bib12)) 来稳定潜在动态学习,但这限制了表示的任务特定适应。LeWorldModel 使用 SigReg 风格的高斯正则化器进行端到端训练,以鼓励非坍缩的潜在特征 (Maeset al.2026 (https://arxiv.org/html/2606.31232#bib.bib2); Balestriero and LeCun2025 (https://arxiv.org/html/2606.31232#bib.bib13))。PLDM 将预测学习与 VICReg 风格的正则化和逆动态相结合 (Sobalet al.2026 (https://arxiv.org/html/2606.31232#bib.bib14); Bardeset al.2021 (https://arxiv.org/html/2606.31232#bib.bib18)),但其动作解码器作用于拼接的状态嵌入,这可能允许动作相关的端点线索支持逆预测,而无需强约束转移本身。相比之下,Delta-JEPA 直接将逆动态应用于潜在位移,使用动作重建使动作引起的潜在差异可区分,同时避免了冻结编码器和复杂的多项正则化。

参考图注 图1:Delta-JEPA 框架概览。原始观测 o_t 和 o_{t+1} 通过共享编码器映射到潜在表示 z_t 和 z_{t+1}。在前向路径中,动态预测器从 z_t 和动作 a_t 预测后续表示 \hat{z}_{t+1},由预测损失 L_pred 指导。同时,潜在差异动作解码器接收潜在位移 Δz_t 以重建动作 \hat{a}_t,由动作损失 L_action 监督。这种基于位移的动作监督鼓励动作引起的潜在差异可区分,整个框架通过 L = L_pred + λ L_action 进行端到端优化。

## 方法

### 问题形式化

遵循无监督潜在世界模型的标准范式,我们专注于在无奖励、离线设置下学习世界模型的问题 (Maeset al.2026 (https://arxiv.org/html/2606.31232#bib.bib2))。给定一个离线数据集 D = {(o_1, a_1, ..., o_T)},包含交替的高维原始图像观测 o_t ∈ R^{C×H×W} 和连续动作 a_t ∈ R^{d_a} 的轨迹。关键的是,D 不包含任何任务特定的奖励信号,并且由任意的、未知的行为策略收集。

我们的目标是学习一个紧凑的潜在表示空间 Z ⊆ R^d,并配备一个动作敏感的潜在动态预测器,而无需重建像素或使用任务奖励。

### Delta-JEPA 概览

如图 1 (https://arxiv.org/html/2606.31232#Sx2.F1) 所示,Delta-JEPA 由两个耦合的目标组成。潜在前向动态预测器学习从当前表示和动作预测下一个表示,为规划提供所需的展开模型。潜在差异动作解码器(LDAD)在相邻潜在状态之间的位移上添加了一个逆动态约束,要求该位移能够恢复导致转移的动作。这些目标共同训练了一个端到端的免重构世界模型,该模型阻止坍缩为动作不敏感的表示,并促进动作敏感的下一个状态预测。

### 潜在前向动态预测器

编码器 f_θ 将每个观测 o_t 映射到潜在表示 z_t = f_θ(o_t)。以 z_t 和动作 a_t 为条件,动态预测器 P_φ 估计下一个潜在状态:

\hat{z}_{t+1} = P_φ(z_t, a_t) (1)

其中 \hat{z}_{t+1} 表示预测的下一个潜在状态。

我们使用潜在空间中的均方预测损失来训练编码器和预测器:

L_pred = ||\hat{z}_{t+1} - z_{t+1}||_2^2 (2)

其中 z_{t+1} = f_θ(o_{t+1}) 是由同一编码器产生的目标表示。

尽管公式 (2 (https://arxiv.org/html/2606.31232#Sx3.E2)) 实现了免重构的动态学习,但单独使用时它是退化的:编码器和预测器可以通过坍缩到几乎恒定的表示来降低损失。即使预测损失很小,这种解也保留了很少的规划信息。LDAD 通过在相邻潜在状态之间的差异上增加一个动作约束来解决这种失败模式。

### 潜在差异动作解码器 (LDAD)

LDAD 在相邻潜在状态之间的差异上施加了一个逆动态约束。给定两个编码后的观测 z_t 和 z_{t+1},我们将潜在位移定义为

Δz_t = z_{t+1} - z_t (3)

然后解码器从该位移预测执行的动作:

\hat{a}_t = D_Θ(Δz_t) (4)

其中 D_Θ 表示动作解码器,\hat{a}_t 表示预测的动作。解码器通过均方动作重建损失进行端到端训练:

L_action = ||\hat{a}_t - a_t||_2^2 (5)

参考图注 图2:LDAD 诱导的动作敏感潜在几何示意图。没有位移级动作监督(左上角),来自同一潜在状态 z_t 的不同动作可能产生相似的下一个嵌入。LDAD 计算每个位移 Δz_t^{(i)} = z_{t+1}^{(i)} - z_t,解码动作 \hat{a}_t^{(i)},并使用 L_action = ||\hat{a}_t - a_t||_2^2 (底部) 进行监督。这鼓励以动作为条件的转移在潜在空间中占据可区分的方向和端点(右上角)。
#### 动作监督的位移机制。

相似文章

DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]

Reddit r/MachineLearning

DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。

SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学

arXiv cs.LG

SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。

用动作条件预测一致性诊断JEPA世界模型

arXiv cs.LG

提出动作条件预测一致性(ACPC),这是一种JEPA世界模型的诊断方法,用于衡量在动作条件展开中干净观测与扰动观测如何发散,并为预测误差和规划器成本提供理论界限。在多个视觉控制任务上的实验验证了该诊断在LeWM和PLDM等模型上的有效性。