潜在规划能否在点云中存活?基于动作条件的JEPA世界模型用于几何观测
摘要
本文研究了动作条件JEPA世界模型能否使用点云观测而非图像进行潜在规划,发现它们成功了,并讨论了对机器人几何感知的影响。
arXiv:2608.29434v1 公告类型:新
摘要:JEPA世界模型使隐空间规划成为控制的实用途径,但它们几乎完全基于图像构建。潜在预测是否能在几何观测中存活尚不清楚:点云是稀疏、无序且自遮挡的,并且在0.3-15%的场景点移动的情况下,潜在预测的慢特征最优性与3D自监督的几何捷径相结合。我们将三种规范的JEPA设计提升到点云:冻结编码器、分布先验和动作敏感型,并重新感知稳定世界模型基准,使得只有观测不同于图像基线。所有三种规划均未崩溃:分布先验模型在每个基准上与其重新评估的图像对应物统计等效,而动作敏感型模型在控制比较中获得了最强结果,其中几何移动最多。探测解释了原因:物体位置几乎完美线性可解码,注意力集中在少数移动点上。规划能够承受训练中从未见过的大量丢失,尽管范围噪声击败了最薄的场景。几何终于使得命令的3D目标成为自然的接口:我们从目标和当前潜在空间构建目标潜在状态,无需目标观测,且成功率为零成本。
查看缓存全文
缓存时间: 2026/09/01 13:15
# 潜在规划能否在点云中存续?面向几何观测的动作条件化JEPA世界模型 来源:https://arxiv.org/html/2608.29434 Fabio F. Oberweger††注:共同第一作者:F.F.O.主导算法开发,M.S.主导数据生成与环境设计。 所属机构:奥地利科技研究院(AIT) 所属机构:辅助与自主系统 邮箱:[[email protected]](mailto:[email protected]) Michael Schwingshackl\* 所属机构:奥地利科技研究院(AIT) 所属机构:辅助与自主系统 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 JEPA世界模型使得潜在空间规划成为控制的有效路径,但其几乎完全基于图像构建。潜在预测是否能在几何观测中保持有效性尚不清楚:点云具有稀疏性、无序性且存在自遮挡,加之仅有0.3%–15%的场景点发生运动,潜在预测的慢特征最优解与3D自监督的几何捷径效应相互叠加。我们将三种经典JEPA设计(冻结编码器、分布先验、动作敏感型)扩展至点云环境,并重新标定stable-world-model基准测试集,确保仅观测模态与图像基准存在差异。三种设计均未出现规划崩溃:分布先验模型在所有基准测试中与其重新评估的图像对应版本在统计学上等效;动作敏感型模型在控制对比中实现了最优结果(此时几何运动最为显著)。探测分析揭示了原因:物体位置几乎完美线性可解码,注意力集中于少数运动点。规划能承受训练中未见的重度数据丢失,但范围噪声会干扰最稀疏的场景。几何观测最终使得命令式3D目标成为自然的目标接口:我们基于目标与当前潜在状态构建目标潜在状态,无需目标观测即可达成相同成功率。 ## 1 引言 参见标题 图 1:从图像环境到点云环境。上:3D场景。下:同一场景生成的点云,取代图像作为观测。 机器人若能预测自身动作的后果,则无需为每个任务编程:控制可简化为搜索。世界模型为物理AI承诺了这一路径[11、12、18]:从原始经验中离线、无奖励地学习动力学,并在测试时规划新行为。联合嵌入预测架构(JEPAs)通过基于动作预测未来*潜在*状态(而非生成观测)使其变得实用,无论是基于冻结特征(DINO-WM[48])、分布先验(LeWorldModel[21])还是动作敏感型(Delta-JEPA[46]、SMWM[16])。然而几乎所有研究都通过相机观察世界。图像作为默认选择具有合理性,传感器成本低廉、语义密集,且可迁移基础模型[33]。但许多机器人以几何方式感知世界,而测距感知技术已臻成熟,可从原始扫描中恢复3D曲线[26]和6自由度物体姿态[32]。缺失的是*预测能力*——可供规划器查询的基于几何观测的世界模型,且潜在预测能否适应这一转变尚不明确。 潜在预测在时序恒定特征上存在平凡最优解[34],当仅1%–15%的场景点运动时,这一最优解异常容易获得[15]。另一方面,3D自监督可通过点高度和表面法线形成几何捷径,因为坐标直接进入算子且无法被掩码[39]。因此点云JEPA面临两条崩溃路径(而图像JEPA仅面临一条),已知的防崩溃机制是否有效属于实证问题。现有3D世界模型未能回答此问题:驾驶模型通过几何保真度生成未来扫描或占用图[44、47、41、19],操作模型解码显式未来几何[15、29],AD-L-JEPA[51]预测潜在状态但不依赖动作。据我们所知,尚无先前工作在点云上学习动作条件化的潜在预测世界模型并利用其进行规划。我们构建了这一缺失环节。 我们将三种经典JEPA设计扩展至点云,隔离每种已知的防崩溃机制,并通过模拟测距传感器重新标定stable-world-model基准测试集,将其与图像对应版本进行对比评估。最后,潜在规划器在推理时需要编码的*目标观测*(对测距传感器而言是从未访问配置的扫描)。几何观测提供了自然接口:我们学习从当前潜在状态与命令式3D目标构建目标潜在状态,从而告知规划器物体应达到的位置,而非展示目标状态的世界图像。 我们的贡献包括: - 点云JEPA世界模型:冻结编码器(Utonia-WM,基于冻结Utonia编码器[45]的新变体)、分布先验(Point-LeWM)和动作敏感型(Point-Delta-JEPA),以及无参数的几何消融模型Vox-WM(Utonia-WM性能优于该模型)。在稀疏近乎静态的扫描中均未崩溃:位置在潜在空间中保持线性可读,注意力集中于运动实体,且规划能很大程度上抵御训练中未见的传感器退化。 - 受控模态对比:重新标定的stable-world-model基准测试集,仅观测模态与图像数据集不同,通过回放验证。Point-LeWM在所有基准测试中与图像基准在统计学上等效,Point-Delta-JEPA在几何运动最显著的场景中超越图像基准(甚至超过其图像对应版本报道的非受控指标)。 - 面向3D目标的规划:一个从当前潜在状态与目标物体姿态预测目标潜在状态的模块,无需目标观测即可替代推理时目标观测,且成功率不降。 ## 2 相关工作 参见标题 图 2:Point-LeWM与Point-Delta-JEPA编码器结构:FPS + 球查询(仅显示部分组)、PointNet[30]分词器和ViT-Tiny[8](其CLS token生成z_t)。下一个潜在状态z_{t+1}(来自相同编码器)通过MSE与预测值̂z_{t+1}匹配。SIGReg[21](Point-LeWM)和动作重建损失[16、46](Point-Delta-JEPA)防止崩溃。 ##### JEPA世界模型。 传统世界模型通过重建[11、12]或奖励预测[13]训练,而JEPAs[18]在表示空间训练动作条件化预测器:DINO-WM[48]确立了冻结编码器变体,PLDM[35]展示了端到端潜在规划,LeWorldModel[21]将端到端训练简化为潜在预测加单一分布正则化器(SIGReg[5])。后续工作增加了时序差分目标[4]、测试时适应[37]、动作敏感性[10]和视频模型后训练[3]。stable-world-model平台[20]将这些模型和规划器整合至我们重新标定的接口中。 两种失败模式划分了该领域:针对慢特征最优解[34],解决方案包括分布正则化[5、43]、价值头[13]以及逆动力学损失(SMWM[16]和Delta-JEPA[46]将其参数化于潜在位移)。针对单步训练在多步展开中的退化,解决方案包括潜在超调、多步目标以及模型自身预测的暴露[12、3、4、24]。所有研究均基于图像或本体感觉状态评估。 ##### 点云世界模型。 现有路径均未进行潜在空间规划:*操作*模型回归未来几何:PointWorld[15]预测逐点位移并在真实机械臂上驱动MPPI,3D Point World Models[29]在动力学前进行点补全,两者均在解码后的点云上支付规划成本。*驾驶*模型为生成式:Copilot4D[44]和OccWorld[47]合成未来扫描或占用图,ViDAR[41]将点云预测作为预训练任务,LiSTAR[19]展示了传感器几何如何强烈影响架构设计,但均未进行候选动作搜索。最接近我们的是AD-L-JEPA[51]及其时序扩展[50],它们将掩码*潜在*预测应用于汽车扫描,后者在3D潜在空间验证了SIGReg,但两者均通过微调评估且不依赖动作条件。FR3D[24]在冻结的3D重建潜在空间进行预测,但为单目且不依赖动作。 冻结编码器方法还预设了通用3D编码器:Sonata[39]识别出第1节中的3D自监督几何捷径,Utonia[45]训练了跨点云领域的3D基础模型。 ##### 目标指定与规划。 潜在世界模型通过基于采样的MPC进行规划[12、13、48],在无奖励设置中,目标以*编码目标观测*形式输入[20]。该接口随目标时间跨度增加而急剧退化[22、6],且预设目标状态观测必然存在。FF-JEPA[22]通过预测潜在子目标去除目标图像,但其目标隐含在演示中,因此规划器无法被命令执行任意目标。PRISM[38]和SAGE[6]保留编码目标并改进搜索,Nguyen等人[25]将该搜索压缩为一个目标和时间跨度条件化的逆动力学模型。在3D领域,PointWorld[15]针对选定点子集的目标位置进行规划,实质上是具有已知对应关系的稀疏目标云,这种成本仅能由预测显式几何的模型评估。 在世界模型外,坐标目标是标准做法,从目标条件化RL[2]到PointGoal导航[1]。我们探索另一种方式:保留显式目标指定,将其表示为任务相关物体的3D姿态,并学习构建上述规划器所缺乏的目标潜在状态(无需目标观测)。 参见标题 图 3:Utonia-WM结构:冻结Utonia[40、45]将点云编码为超点特征,固定规范帧体素网格将其分箱为约256个token(仅显示部分单元格)。每个单元格的特征通过固定随机正交投影池化并压缩至预测器宽度。仅预测器参与训练,对冻结目标z_{t+1}进行逐token MSE损失优化。 ## 3 方法 第3.1节为stable-world-model环境配备模拟LiDAR。第3.2节在生成的点云上实例化三种经典JEPA世界模型设计,并提出一个互补模块以消除推理时对目标观测的需求。 ### 3.1 点云感知与数据集复现 为比较观测模态而非数据集,我们重新标定已发布图像基准而非采集新数据:在模拟器中为每个原始数据集视角附加光线投射测距传感器,重放所有记录状态,并将生成的点云与原始观测按行对齐存储。情节、长度、动作和目标与图像数据集完全一致。表1说明各环境的其他变更项。 表 1:四个重新标定的数据集。*地面占比*与*运动返回占比*分别为地面平面和非静态实体上的返回点比例,两者在各环境内恒定。 ##### 传感器。 传感器投射固定100×100光线网格,与搭载相机的视场匹配,记录每条光线在环境最大范围内的首次交点。返回值以传感器坐标系表示(x向前,y向左,z向上),未相交的光线取哨兵值,因此每帧为固定(10,000,3)数组。传感器为理想模型:精确交点、无噪声、无丢失或扫描失真,因此比较仅隔离观测几何差异。仅OGBench立方体[27]提供可搭载相机。其他环境仅提供俯视图,导致扫描退化,故我们将传感器斜置于45°方位角与仰角(由场景边界球导出而非调参),视角难度高于图像基准的俯视渲染。 ##### 数据集复现。 转换将每个记录状态写入环境并在不推进物理模拟的情况下投射扫描。输出表包含所有原始列及点云数据。
相似文章
用动作条件预测一致性诊断JEPA世界模型
提出动作条件预测一致性(ACPC),这是一种JEPA世界模型的诊断方法,用于衡量在动作条件展开中干净观测与扰动观测如何发散,并为预测误差和规划器成本提供理论界限。在多个视觉控制任务上的实验验证了该诊断在LeWM和PLDM等模型上的有效性。
时序距离JEPA:面向潜在世界模型预测控制的规划感知表示学习
提出时序距离JEPA(TD-JEPA),从离线轨迹中挖掘有向时序代价,以改进潜在世界模型预测控制,在机器人环境中实现了更高的成功率。
基于潜世界模型的强化规划
本文介绍了强化规划,一种利用潜世界模型学习改进多步骤规划的方法,在视觉导航和机器人操作等任务中取得了近乎完美的成功率,并且效率显著高于手工设计的算法。
@artemZholus:谢谢!在第二篇论文(https://arxiv.org/abs/2605.06388)中,我们采用了您(和RAE)的方案,效果不错。
本文系统地比较了基于重建和基于语义的潜在空间在机器人行动条件潜在扩散世界模型中的应用。研究发现,像V-JEPA 2.1这样的语义编码器在策略相关指标上通常优于重建编码器,从而主张将语义潜在空间作为机器人世界模型的更强基础。
基于世界模型的潜能量行动规划
介绍了潜能量行动规划(LEAP),该方法通过冻结的世界模型优化行动序列,以改善目标条件控制,在四个控制领域中实现成功率提高17.3个百分点。