时序距离JEPA:面向潜在世界模型预测控制的规划感知表示学习
摘要
提出时序距离JEPA(TD-JEPA),从离线轨迹中挖掘有向时序代价,以改进潜在世界模型预测控制,在机器人环境中实现了更高的成功率。
arXiv:2607.25337v1 公告类型:新论文
摘要:联合嵌入预测架构(JEPA)通过在表示空间中进行预测而非重建像素来学习世界模型,因此成为从离线演示日志中进行潜在模型预测控制的自然基础。JEPA风格的训练优化短时域潜在预测,而规划需要根据目标进展对想象的未来进行多步排序。先前的JEPA规划器通常从嵌入几何中继承这种排序,通常是潜在欧氏距离,这是表示学习的副产品,而非从日志中挖掘的进展代价。我们提出了时序距离JEPA(TD-JEPA),它保留了LeWM编码器-预测器骨干,并从无奖励轨迹中挖掘有向时序代价:同一轨迹中的步骤顺序提供正目标,跨轨迹对作为启发式负样本,并且有一个 rollout 一致性项来匹配规划器的时间范围。挖掘到的监督信息发挥两个作用:当进展是拓扑性时,作为部署的规划代价;当接触几何占主导时,作为改进欧氏规划的信号。在锁定评估下,部署该代价将Two-Room的成功率从LeWM的97.4%提升至100.0%,而在同一时序训练检查点上共享欧氏规划,使OGB-Cube比LeWM提高了14.2个百分点,并改进了Push-T。与LeWM及同期基线RC-aux在锁定评估下相比,TD-JEPA在每个环境中都匹配或超越了这两种方法。消融实验表明,有向头、跨轨迹负样本和rollout一致性均有贡献。TD-JEPA通过发现离线日志中的时序进展结构,并共同设计代价形式与规划时部署,缩小了JEPA世界模型规划器的训练-规划差距。代码可在 https://github.com/HKBU-KnowComp/TD-JEPA 获取。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 时间距离JEPA:面向潜在世界模型预测控制的规划感知表示学习 来源:https://arxiv.org/html/2607.25337 作者:Jiaxuan Xiong,香港浸会大学,香港,中国 ###### 摘要。 联合嵌入预测架构(JEPA)通过在表示空间中进行预测而非重建像素来学习世界模型,因此它们成为基于离线下发日志进行潜在模型预测控制的自然基础。JEPA风格的训练优化短期潜在预测,而规划则需要根据目标进展对多步想象未来进行排序。先前的JEPA规划器通常从嵌入几何中继承这种排序,通常是潜在欧氏距离,这是表示学习的副产品,而非从日志中挖掘出的进展成本。我们提出时间距离JEPA(TD-JEPA),它保留LeWM编码器-预测器骨干,并从无奖励轨迹中挖掘有向时间成本:同轨迹步序提供正目标,跨轨迹对作为启发式负例,滚动一致性项匹配规划器视界。挖掘出的监督扮演两个角色:当进展是拓扑性质时,作为部署的规划成本;当接触几何主导时,作为改善欧氏规划的信号。在锁定评估下,部署挖掘的成本将Two-Room成功率提升至100.0%(对比LeWM的97.4%),而在同一时间训练检查点上共享欧氏规划将OGB-Cube提升14.2个百分点,并改进Push-T。在锁定评估下,与LeWM及同期基线RC-aux相比,TD-JEPA在每个环境中均达到或超越两者。消融实验表明,有向头、跨轨迹负例和滚动一致性各有贡献。TD-JEPA通过发现离线日志中的时间进展结构,并将成本形式与规划部署时间协同设计,缩小了JEPA世界模型规划器的训练-规划差距。代码见https://github.com/HKBU-KnowComp/TD-JEPA。 ††copyright:none ## 1. 引言 世界模型旨在捕获足够的环境结构,使得智能体无需在真实世界中行动即可推理未来(Li, 2026)。在规划器面向的角色中(本文的动机),世界模型编码观测,想象候选动作序列的后果,并根据这些想象未来将智能体带近目标的程度对其进行排序。当唯一可用的监督是离线下发日志(无密集奖励的观测-动作轨迹)时,仅靠预测动力学无法产生规划器可以信任的进展信号。 联合嵌入预测架构(JEPA)为此设置提供了自然基础(LeCun, 2022;Balestriero and LeCun, 2025)。JEPA不重建像素,而是学习一个将观测映射到潜在空间的编码器,以及一个从上下文和动作预测未来嵌入的预测器。有用的世界知识存在于表示的预测结构中:如果模型能够预见嵌入空间中接下来会发生什么,它就内化了世界动态的某些方面,而无需承诺生成式解码器。LeWM将这一配方实例化用于潜在控制(Maes et al., 2026)。它训练一个动作条件编码器-预测器进行下一步潜在预测,使用SIGReg正则化表示以避免崩溃(Balestriero and LeCun, 2025),并在测试时使用CEM搜索动作序列(de Boer et al., 2005),通过欧氏距离对每个想象终端潜在与目标嵌入进行评分。 这种设计产生了强大的预测骨干,然而在所学内容与规划需求之间留下了结构性差距。JEPA风格的训练优化潜在空间中的短期预测;潜在模型预测控制(MPC)需要的是按目标进展对多步未来进行排序。在LeWM及相关JEPA规划器中,这种排序通常继承自嵌入几何:潜在之间的欧氏距离成为事实上的规划成本。当局部外观与控制一同推进时,几何可能与进展相关,但它并非为反映到目标的步数、有向可达性或规划器排序而训练。并行的规划感知JEPA变体部分解决了这一不匹配:使用离线RL进行值塑造(Destrade et al., 2026)、潜在路径的时间拉直(Wang et al., 2026b)、视界条件可达性辅助(Li et al., 2026)和进展子空间(Thil et al., 2026)。这些方法要么引入超越演示日志的值估计器,要么重塑几何但没有显式规划成本,要么将时间结构视为辅助而非MPC可发现的排序信号。 因此我们问:*无奖励演示轨迹如何产生时间进展结构,从而缩小JEPA世界模型规划器的训练-规划差距?这种结构何时应作为规划成本部署,何时应仅用于为几何规划塑造表示?* 图1在Push-T上具体展示了这种排序差距。在留出演示对上,LeWM的潜在欧氏距离与时间间隔的Spearman相关系数ρ=0.65,而从相同日志中挖掘的成本跟踪步序的ρ=0.95。这种挖掘信号是否也能改善控制——以及在哪种规划时间成本下——是下面要研究的实证问题。 参见标题 **图1. Push-T留出演示对的时间间隔对齐。** 两个并排散点图,x轴为真实时间距离,每个面板y轴独立。左:LeWM潜在L2(范围0-25)散点广泛且弱单调,红色线性拟合线浅,Spearman rho 0.65。右:TD-JEPA学习到的d_psi(范围0-8)沿红色拟合线紧密递增,Spearman rho 0.95;未画y=x参考线,因为步数与学习到的能量单位不同。 我们提出**时间距离JEPA (TD-JEPA)** 来解决这一挑战。TD-JEPA保留LeWM编码器-预测器和SIGReg骨干,并挖掘一个目标条件能量,当滚动出的潜在与到达目标相容时能量低(LeCun et al., 2006)。由于动作下的目标到达通常是非对称的,成本是有向的而非欧氏(Wang et al., 2023):它依赖于当前和潜在目标的有序对,因此从A到B的代价与反向不必相同。监督来自轨迹挖掘而非奖励。同轨迹步序提供正时间目标;跨轨迹对作为启发式负例,抑制虚假的离轨低成本;滚动一致性项将学习到的成本与规划器使用的开环视界对齐(图2)。 挖掘的信号扮演两个角色,规划时间成本的选择遵循任务结构。当进展主要是拓扑时(如导航和到达),有向时间成本是自然的规划目标。当接触几何主导时,同一时间训练检查点使用潜在欧氏距离进行规划,因此时间监督塑造了几何规划器使用的表示。我们对拓扑主导的控制部署d_psi,对接触丰富的控制部署潜在l2;后续章节将此称为设计选择,而非重新论证。 锁定评估支持这两个角色。部署挖掘成本在Two-Room和Reacher上优于LeWM;在同一时间训练检查点上共享欧氏规划将OGB-Cube提升14.2个百分点,并改进Push-T。在锁定评估下与LeWM和RC-aux(Li et al., 2026)相比,TD-JEPA在每个环境中均达到或超越两者。消融实验表明有向头、跨轨迹负例和滚动一致性各有贡献,而接触阶段诊断澄清了何时必须在规划时间选择几何。 #### 贡献。 - • **对JEPA训练-规划差距的清晰诊断。** 我们展示了预测性JEPA世界模型从离线日志学习动态,而规划时间评分通常依赖潜在嵌入几何而非显式挖掘的时间进展成本,并且日志导出的有向成本缩小了这种排序不匹配的大部分(图1)。 - • **针对JEPA规划器的时间距离挖掘。** 我们引入TD-JEPA,保留LeWM骨干并添加有向时间监督、跨轨迹负例和视界匹配的滚动一致性,使得在演示中发现的进展结构既可作为部署的规划成本,也可作为表示信号(第3节)。 - • **成本形式与部署应协同设计的证据。** 在匹配评估下,部署挖掘成本在拓扑主导进展时帮助,而在同一时间训练检查点上共享欧氏规划在接触丰富任务上帮助;消融和接触阶段分析识别了每种选择的适用时机(表2、5、4和9)。 ## 2. 相关工作 **基于能量的学习与规划。** 基于能量的模型将低能量与相容变量分配关联,并通过能量最小化进行推理(LeCun et al., 2006)。潜在MPC符合这一模板,通过搜索使想象展开后终端能量最小的动作序列。值引导和准度量方法从离线数据学习能量或值,为目标条件规划成本提供基础(Wang et al., 2023;Destrade et al., 2026)。TD-JEPA遵循相同的推理视角,但改变了知识来源:它从无奖励步数标签和演示日志中的跨轨迹负对中挖掘有向时间成本,而非值目标(van den Oord et al., 2018;Kostrikov et al., 2021)。 **JEPA与LeWM。** 像素级潜在空间规划早于JEPA控制。PlaNet学习随机潜在动态并使用预测奖励进行在线规划,而TD-MPC通过时间差分学习联合学习任务导向动态和终端值(Hafner et al., 2019;Hansen et al., 2022)。JEPA则从数据中学习预测表示而不重建像素;LeJEPA引入SIGReg实现稳定自监督,LeWM将这一配方与潜在规划结合(Balestriero and LeCun, 2025;Maes et al., 2026)。最近的工作探索关系干预、在线适应和时间抽象(Nam et al., 2026;Wang et al., 2026a;Zhang et al., 2026;Masip et al., 2026)。TD-JEPA保持LeWM动态骨干不变,而是挖掘规划器消耗的目标进展成本。 核心区别在于任务结构在哪里被发现。PlaNet通过重构性潜在模型学习奖励,TD-MPC通过在线交互学习奖励和值预测。LeWM移除奖励预测,将自监督预测表示中的距离视为目标成本。TD-JEPA保持无奖励,但通过从演示日志中挖掘时间顺序使进展监督显式化。因此它针对的是潜在预测与动作搜索之间缺失的目标,而非替换动态架构或引入学习策略。 **值塑造与时间视觉表示。** VIP学习时间平滑的视觉嵌入,其距离作为目标条件奖励;LIV将值塑造表示学习扩展到语言和图像目标(Ma et al., 2023b, a)。TLDR学习时间距离感知表示用于目标选择、内在奖励和目标条件策略学习(Bae et al., 2024)。这些方法使用值或时间距离来塑造奖励和策略。TD-JEPA则在动作条件JEPA世界模型内部挖掘有向成本,并用该成本对想象展开排序。VIP和LIV为下游控制器提供奖励信号;TLDR训练目标条件策略和探索目标。TD-JEPA保持在离线、无奖励设置下:无奖励模型、无策略学习器,仅有从日志中发现并被规划消耗的时间成本。 **规划感知的潜在几何。** 当MPC在度量不与可达性对齐的潜在空间上搜索多步展开时,精确的短期预测是不足的。Destrade等人塑造JEPA嵌入,使得准度量距离近似使用IQL学习的目标条件值函数,然后在该几何上使用MPC规划(Destrade et al., 2026)。与Value-Guided JEPA不同,TD-JEPA无需IQL值估计器:它在LeWM+SIGReg骨干上挖掘无奖励步数标签,并评估任务相关的d_psi与潜在l2部署(表1)。Wang等人正则化潜在曲率,使得欧氏距离在时间拉直后更好地跟踪测地进展(Wang et al., 2026b)。RC-aux在LeWM之上添加多视界开环预测和预算条件可达性监督,区分规划器视界内可达的状态与仅最终可达的状态(Li et al., 2026)。SD-JEPA将潜在划分为正交的进展和内容子空间,使用余弦边界三元组损失训练角度坐标,同时在其余部分保留SIGReg(Thil et al., 2026)。层次规划器和潜在规划器JEPA则修改推理结构,使用粗粒度潜在模型或无动作子目标预测器来减少长视界搜索难度(Zhang et al., 2026;Masip et al., 2026)。 **表1. TD-JEPA与规划感知JEPA变体对比。** (注:原文未提供具体表格内容,但标题或后续有解释) **准度量与目标条件RL。** 准度量表示建模有向可达距离;最优目标-
相似文章
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
面向目标无关的偏微分方程联合嵌入预测控制
本文提出了一种面向偏微分方程的目标无关控制框架,采用联合嵌入预测架构(JEPA),并配备轻量级2D ViT编码器和动作条件潜在动力学。研究表明,使用学到的物理可观测探针在控制任务中优于原始潜在距离。
@yingwww_: 温暖提示:你的世界模型永远不应该停止学习。介绍AdaJEPA,一个自适应的世界模型,可以规划、行动和适应……
AdaJEPA引入了一种自适应的潜在世界模型,该模型在测试期间通过闭环模型预测控制持续更新,显著提高了分布偏移下的规划成功率。
我构建了Micro-JEPA:一个轻量级的JEPA(联合嵌入预测架构)Python实现
Micro-JEPA 是一个轻量级的JEPA(联合嵌入预测架构)Python实现,使智能体能够学习环境表征、在潜在空间中预测未来状态,并规划动作以避开障碍物。
Sub-JEPA:用于稳定端到端世界模型的子空间高斯正则化
作者提出了 Sub-JEPA,这是一种利用子空间高斯正则化来提高 LeWM 等端到端世界模型稳定性的方法,在连续控制基准测试中表现出一致的性能提升。