XP-JEPA: 跨预测物理基础的可预测潜在动态

arXiv cs.LG 论文

摘要

XP-JEPA 通过引入跨预测物理基础来改善潜在动态,从而在世界模型中实现更好的可预测控制,且在测试时无需物理输入。

arXiv:2608.24044v1 公告类型:新 摘要: 潜在世界模型通过预测候选动作如何改变学习到的表示来规划。然而,在自预测模型中,编码器和预测器联合优化,并且可以共同适应易于预测但仅受场景物理演化弱约束的潜在转变。我们引入了跨预测JEPA(XP-JEPA),它将视觉潜在动态基于特权物理轨迹。XP-JEPA分别编码视觉观察和物理状态,通过共享的动作条件预测器推进两者,并将每个预测匹配到未来的表示。此目标鼓励跨两种模态的统一潜在动态,基于底层物理转变。训练后丢弃物理分支,部署时只留下视觉模型。在涵盖六个评估子类别的多任务套件上,XP-JEPA将新拟合预测器的展开漂移从$0.361$降低到$0.104$,并将平均控制成功率从$53.6\%$提高到$78.2\%$。直接物理状态回归提高了位置可解码性,但使可预测性和控制接近仅视觉基线。因此,跨预测物理基础可以在测试时无需特权输入的情况下,为基于展开的控制产生更可预测的潜在动态。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:31

# XP-JEPA:基于交叉预测物理约束的可预测潜动态
来源:https://arxiv.org/html/2608.24044
作者:Ziming Li (隶属单位:新加坡国立大学电气与计算机工程系), Siyuan Luo (隶属单位:新加坡国立大学电气与计算机工程系), Fan Shi (隶属单位:新加坡国立大学电气与计算机工程系)

###### 摘要

潜世界模型通过预测候选动作如何转化学习到的表征来进行规划。然而,在自预测模型中,编码器和预测器是联合优化的,它们可能会共同适应于那些易于预测但仅受场景物理演化弱约束的潜在状态转换。我们引入了交叉预测JEPA(XP-JEPA),它将视觉潜动态锚定于特权物理轨迹。XP-JEPA分别编码视觉观测和物理状态,并通过一个共享的动作条件预测器推进两者,同时将每个预测结果与两种未来表征进行匹配。此目标鼓励跨两种模态的统一潜动态,并锚定于底层的物理转换。训练后丢弃物理分支,部署时保留仅视觉模型。在涵盖六个评估子族的多任务测试套件中,XP-JEPA将新拟合预测器的展开漂移从0.361降低到0.104,并将平均控制成功率从53.6%提高到78.2%。直接的物理状态回归提高了位置可解码性,但使预测性和控制性能接近仅视觉基线。因此,交叉预测物理约束可以在测试时无需特权输入的情况下,产生更可预测的潜动态,从而有利于基于展开的控制。

## 1 引言

使用潜世界模型进行规划将控制任务转化为在表征空间中的搜索(Ha和Schmidhuber, 2018; Hafner等人, 2019; Hafner等人, 2025; Hansen等人, 2024):智能体编码当前场景,通过学习的动力学展开候选动作,并选择预测结果接近目标的动作。这需要具有可靠动作条件动态的表征。然而,在自预测世界模型中(LeCun, 2022; Assran等人, 2023; Zhou等人, 2024; Sobal等人, 2025),表征和预测器是联合优化的,可能会共同适应于那些内部可预测但仅受底层物理演化弱约束的潜在状态转换。图1展示了这种允许的失败模式:两个投影到几乎相同图像的状态,在相同动作下可能向相反方向演化,而自预测目标并不要求它们的潜在转换分离开来。

(图1注释)物理约束区分了看似相似但演化不同的交互作用。*左图:* 在A中,木块被夹持;在B中,它静止在沿同一相机射线更远的位置,因此相同的提升动作仅在A中移动它(插图放大了同一物体窗口)。*右上角(示意图):* 两个观测的编码几乎相同,自预测目标无论其预测未来是否分离都能满足;将每个预测的视觉转换与对应的物理未来匹配,会将它们拉开,夹持状态是从几何推断而非作为接触标签给出。物理分支仅在训练时使用。*右下角:* 三次随机种子平均控制成功率,单任务值取自表2(文中引用)四个环境的平均值,增益因任务而异。

特权物理状态提供了一个外部参考,用于减少这种歧义。物理轨迹描述了场景在动作作用下的演化方式,采用统一的坐标系,这使得监督能够同时约束表征保留的信息以及该信息如何演化。我们利用这种训练时信号来鼓励与相应物理轨迹兼容的视觉潜动态。

现有方法通常使用特权信息通过知识蒸馏、状态回归、跨模态对齐或训练时评估器来监督表征内容或下游行为(Chen等人, 2020; Gupta等人, 2016; Tian等人, 2020; Kumar等人, 2021; Pinto等人, 2018)。然而,对于潜规划而言,使物理状态可从单个潜在快照解码,并不一定能约束这些潜变量在动作下如何演化。我们转而探讨特权物理轨迹如何监督预测转换本身。

我们区分与潜规划相关的三个属性。**可解码性**询问是否可以从单个潜在状态恢复物理变量。**可预测性**询问表征是否允许随时间推移的可靠动作条件预测。**规划效用**进一步取决于预测的潜在结果是否保留了排序候选动作所需的区分度。这些属性不一定重合:使物理状态可从快照访问并不一定简化其预测演化;可预测的潜动态本身也不一定为控制提供有用的几何结构。因此,我们的目标不是简单地编码更多物理信息,而是使用相应的物理轨迹来约束预测演化。

我们引入*交叉预测JEPA*(XP-JEPA),它将视觉观测和特权物理状态视为同一轨迹的两个视图。一个共享的动作条件预测器推进来自任一视图的历史,并将每个预测与相应的视觉和物理未来进行匹配。模态内项保留自预测,而跨模态项将每个预测转换锚定于另一模态的未来。训练后丢弃物理分支,在部署时保留与仅视觉基线相同的视觉编码器-预测器架构和规划器。

我们的实验将物理变量的可解码性与潜动态的可预测性区分开来,并将两者与规划效用区分开来。一个在多组物体-交互对上训练的模型,在所有六个评估子族中具有更低的展开漂移和更高的控制成功率。回归一个全面的基于姿态的状态目标提高了位置可解码性,但使预测性和控制性能接近仅视觉基线。这种对比区分了快照内容与转换结构:使物理变量可从单个潜在状态访问本身并不能产生XP-JEPA所观察到的可预测动态。更可预测的潜动态可以使基于展开的控制受益,但消融研究表明,仅可预测性并不能保证规划效用。

我们的贡献包括:

- • 交叉预测JEPA:潜转换的物理约束。XP-JEPA通过将视觉和物理历史通过共享的动作条件预测器推进,并将每个预测与两种模态的未来匹配,将潜转换锚定于特权物理轨迹,同时在部署时保留仅视觉架构。
- • 统一的特权状态接口。我们设计了一个统一的特权状态接口,允许单个物理编码器在不同的刚体操作场景中运行,无需特定任务标签。
- • 可预测动态与改进的控制。XP-JEPA在多任务测试套件和所有四个匹配的单任务环境中产生了更可预测的视觉动态,同时将平均多任务控制成功率从53.6%提高到78.2%。

## 2 相关工作

### 预测性潜世界模型

世界模型在其学习表征保留的结构上有所不同。基于重建的方法通过像素或生成式潜变量学习动力学(Ha和Schmidhuber, 2018; Hafner等人, 2019; Hafner等人, 2020; Hafner等人, 2025),而以价值为中心的方法则围绕奖励和控制目标塑造表征(Schrittwieser等人, 2020; Hansen等人, 2024)。表征预测方法则直接建模未来特征:DINO-WM在预训练视觉特征中进行规划(Zhou等人, 2024),PLDM从无奖励离线数据中学习潜动态(Sobal等人, 2025),LeWM联合学习视觉表征和预测动力学(Maes等人, 2026)。更广泛地说,联合嵌入目标通过预测特征空间目标而非重建观测来学习表征(LeCun, 2022; Assran等人, 2023; Bardes等人, 2023; Bardes等人, 2024)。我们的工作建立在这一预测范式之上,并探讨相应的物理轨迹如何约束联合优化的视觉编码器和预测器所学习的转换结构。

### 跨异构任务的特权监督

利用特权信息进行学习使用的是训练时可用但部署时不可用的信号(Vapnik和Izmailov, 2015)。先前的工作通过知识蒸馏、跨模态对齐、状态回归、特权感知或非对称Actor-Critic训练来转移此类信息(Chen等人, 2020; Lee等人, 2020; Gupta等人, 2016; Tian等人, 2020; Kumar等人, 2021; Pinto等人, 2018)。这些方法提供了在训练时利用额外物理信息的几种方式,但我们的多任务设置引入了进一步要求:特权表征必须在异构的物体-交互配置中保持一致的含义。因此,我们通过一个基于物体几何形状、范围、姿态和执行器状态的共享刚体范式来表示场景,允许单个物理编码器在所有配置中提供特权信息流,无需特定任务标签。

### 预测动力学的物理约束

最近的几种世界模型方法将特权物理信息更接近学习到的动力学。TWIST将基于状态的动力学迁移给基于图像的学生模型(Yamada等人, 2024),Scaffolder在策略学习期间使用特权传感器(Hu等人, 2024),PIGDreamer将世界模型表征与特权信息对齐(Huang等人, 2025),Pri4R在视觉-语言-动作训练期间引入特权4D预测(Kim等人, 2026)。与我们设置最接近的是,同期的Phys-JEPA对多变量时间序列预测的潜状态和转换施加物理一致性约束(Nie等人, 2026),而PhyLatent则向LeWM骨干网络添加了仅训练时的物理约束和未来对齐目标(Zeng等人, 2026)。XP-JEPA则将特权状态视为第二个在线预测视图:来自任一模态的历史预测两种模态中对应的未来表征,直接将视觉-物理对应关系与动作条件演化耦合。与单向蒸馏到固定物理目标不同,两种表征都保持在线状态,并且特权分支在部署时被完全移除。我们进一步研究了这种耦合在多任务设置中的应用,其中一个模型和一个统一的特权状态接口跨越了许多物体-交互配置。

## 3 交叉预测JEPA

XP-JEPA在训练期间通过特权物理状态增强了一个JEPA风格的视觉世界模型。它将物理状态视为同一轨迹的第二个预测视图,使用物理转换来约束视觉潜动态,而不仅仅是使状态可解码。XP-JEPA的概述如图2所示(文中引用)。

### 核心目标

我们基于LeWM(Maes等人, 2026)构建,它联合学习一个视觉编码器 $f_\theta$ 和一个动作条件预测器 $g_\psi$。观测 $o_t$ 被编码为 $z_t^o = f_\theta(o_t)$。给定一个视觉潜变量的历史 $Z_t^o$ 和一个动作块 $a_t$,预测器估计未来观测的表征。LeWM使用自预测项 $\|g_\psi(Z_t^o, a_t) - z_{t+1}^o\|_2^2$ 和下文定义的各向同性正则化项 $\beta\Omega(z^o)$ 联合训练 $f_\theta$ 和 $g_\psi$。XP-JEPA保留此项并增加一个物理分支——另一个在特权状态上的编码器 $h_\phi$——以及物理自预测和两个跨模态预测项。在部署时,候选动作序列通过这些潜动态向前展开,其预测结果与编码后的目标进行比较。

我们将特权状态 $s_t$ 作为同一场景的第二个训练时描述引入。物理编码器 $h_\phi$ 使用下文描述的统一特权状态接口将其映射为 $z_t^s = h_\phi(s_t)$。特权输入仅包含瞬时场景配置;它不包括速度、接触力、力矩以及与目标相关的量。两种模态都必须从时间上下文和动作中推断运动。

令 $Z_t^m$ 表示来自模态 $m \in \{o,s\}$ 的潜历史。来自两种模态的历史由同一个动作条件预测器推进。

我们优化

$$\mathcal{L}_{\text{XP-JEPA}} = \sum_{m,n \in \{o,s\}} \left\|g_\psi(Z_t^m, a_t) - z_{t+1}^n\right\|_2^2 + \beta \left[\Omega(z^o) + \Omega(z^s)\right], \tag{1}$$

其中 $\Omega$ 是每个分支的各向同性正则化器(Balestriero和LeCun, 2025, SIGReg),并且动作通过AdaLN(Peebles和Xie, 2022)调制预测器。

相似文章

面向目标无关的偏微分方程联合嵌入预测控制

arXiv cs.LG

本文提出了一种面向偏微分方程的目标无关控制框架,采用联合嵌入预测架构(JEPA),并配备轻量级2D ViT编码器和动作条件潜在动力学。研究表明,使用学到的物理可观测探针在控制任务中优于原始潜在距离。

SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学

arXiv cs.LG

SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。