瓶颈在于目标:潜在世界模型编码了规划器无法利用的信息
摘要
本文探讨了潜在世界模型为何在长时程规划中失败,发现瓶颈在于规划目标(潜在距离的平方)而非预测器的准确性;用学得的代价函数替换该目标可显著提升规划性能。
arXiv:2608.12959v1 公告类型:新
摘要:潜在世界模型以其预测好坏为评判标准,因此当长时程规划失败时,自然的解读是预测器性能下降。我们在 TwoRoom 上复现 LeWorldModel 后表明,制约因素实际上是规划器的目标。
预测器不是限制因素:它想象出的七十五个环境步骤后的状态,其误差仅为假设世界冻结时的 0.189,而规划器从不想象超过二十五步。目标才是限制因素。交叉熵方法规划最小化潜在距离的平方,该平方距离与真实距离的相关性为 r = 0.426,约在八十个竞技场单位处饱和,并在超过一百二十后下降,因此远离目标反而可能降低代价。信息始终存在:岭探针从冻结嵌入中恢复位置,R² 为 0.9922。
这一病态现象属于该方法本身,而非某个复现实现。它存在于作者发布的权重中,并且在四个检查点上,长时程成功率与度量质量完全正相关,与预测精度负相关。
仅替换目标函数,不做任何重训练、不使用 GPU,就能将偏移量 100 处的目标达成率从 26.0% 提升至 98.0%,与偏移量 25 处的 98.0% 持平,并在不到三分之一的预算下达到 92.0%:规划不再依赖视界。最好的代价不是最精确的代价。仅从帧分离学得的头,其空间距离预测能力比位置探针差(r = 0.819 对 0.9897),但规划效果更好,穿越环境分隔墙的代价高出 24%,而潜在距离平方的代价则低 4%。它学到的是可达性,而非邻近性。
查看缓存全文
缓存时间: 2026/08/14 09:32
# 目标即瓶颈:潜在世界模型编码了规划者无法使用的内容
来源:https://arxiv.org/html/2608.12959
Joyjeet Singh joyjeetsingh1@gmail\.com
###### 摘要
潜在世界模型以其预测好坏来评判,因此当基于其进行的长时域规划失败时,自然的解读是预测器退化。在对TwoRoom上的LeWorldModel的一次复现中,我们表明约束瓶颈反而是规划者的目标。
预测器并非限制:在真实验证片段上展开时,其想象的七十五个环境步之后的状态,其错误程度仅为“假设世界冻结”基线错误的0.189,而规划者从不想象超过二十五步。目标才是限制。交叉熵法规划最小化平方潜在距离,该距离与真实距离的相关系数r=0.426,约在八十个场地单位后停止上升,并在约一百二十之后*下降*——因此远离目标反而可能降低规划者的代价。信息始终存在:岭探针从同一冻结嵌入中恢复位置,R²达0.9922。
这种病理性属于方法本身,而非某一重新实现独有的。它出现在作者发布的权重中;在四个检查点上,长时域成功与这一度量的质量精确地单调一致,并与单步预测精度单调相反——这是复现报告但未作解释的一种解离机制。
只替换目标,不重训练任何内容、无需GPU,即可将偏移100处达到目标的比例从26.0%提升至98.0%,等于偏移25处达到的98.0%,而且在三分之一的预算下仍能达到92.0%:规划不再依赖时域。最优代价并非最精确的代价。仅从帧间隔学习到的头部对*空间*距离的预测不如位置探针(r=0.819对比0.9897),但规划效果更好,因为它对穿越环境的分隔墙多收取24%的代价,而平方潜在距离则少收取4%。它学到的是可达性,而非邻近性。
我们还报告了修复失效之处:在作者权重上,学习到的代价被线性代价击败(34.0%对比70.0%),原因是在编码帧上拟合的头部却在想象帧上被评估,而它们的预测器漂移到了足以让MLP外推的程度。学习型规划代价必须在规划器所评分的分布上训练。
## 1 引言
潜在世界模型以预测为目标来训练。能够准确预测下一潜在状态的模型被认为学到了动力学,并且预期可以在此基础上进行规划。当情况并非如此时,通常的怀疑对象是预测器的时域、容量或训练量。
本文报告了一个所有这些都不是原因的情形。基于对TwoRoom环境中LeWorldModel(arXiv:2608.10145)的已发表复现——其中规划在二十五步外的目标上达到94.0%,在一百步外的目标上仅达26.0%——我们询问模型需要什么才能弥合这一差距。答案结果是:什么都不需要。
复现论文报告了这一差距,并有意不提供其机制。它还报告了一件更奇怪的事:在三个检查点上,单步预测精度与短时域规划成功单调一致,却完全无法排序长时域成功,而精度最低的检查点反而是最强长时域规划器。这两个观察有同一解释,且与预测无关。
### 贡献
1. 预测器不是瓶颈。想象至少到七十五个环境步仍然有效;规划者只使用二十五步(§3)。
2. 规划目标饱和然后反转。CEM所最小化的平方潜在距离在真实距离超过约一百二十个单位后不再单调,因此远离目标可能降低规划者的代价(§4)。
3. 该病理属于方法本身,而非某次重新实现。它出现在原作者发布的权重中(§5)。
4. 精度/规划解离的一个机制。在四个检查点上,长时域成功与度量质量精确地单调一致,并与预测精度单调相反(§5)。
5. 信息俱在;只是度量失效。位置可从冻结嵌入解码,R²=0.9922(§6)。
6. 一种无需重训练的修复,对作者自己的权重有效,且不依赖于环境具有可读状态(§7,§8)。
7. 可达性而非邻近性才是正确目标。预测空间距离更差的代价,规划效果反而更好,因为它对墙收费。三种目标的规划成功率与它们各自捕获可达性的程度排序一致(§7.3,§8)。
8. 学习型代价必须基于规划器所评分的内容训练——即想象嵌入,而非编码帧。这在方法开发所用的检查点上不可见;在另一个检查点上却决定成败(§7.4)。
9. 一个条件性处方,包括修复失效之处。学习型代价在预测器支持它的地方获胜,在不支持的地方输给线性代价(§8.2)。
### 范围
一个环境,每个检查点一粒种子,共四个检查点。TwoRoom是一个诊断性环境,本文最强的主张只关乎它。§9说明这允许什么、不允许什么。
## 2 设置
所有实验均使用随复现发布的检查点和评估框架。世界模型是一个18.03M参数的联合嵌入预测架构:ViT-Tiny编码器在224px下产生192维嵌入,以及一个以动作编码为条件的六层预测器。
规划是在学习到的动力学上的交叉熵法搜索,使用发布配置:300条候选序列、30次精化迭代、30个精英、时域5,以及滚动时域5。规划器输出一个二维动作,环境以frameskip=5步执行,因此规划时域5对应于25个环境步的想象。
目标。CEM按以下代价对每个候选评分:
cost=∥z^T−zgoal∥22\text{cost}=\lVert\hat{z}_{T}-z_{\text{goal}}\rVert_{2}^{2}
即想象最终嵌入与目标图像嵌入之间的平方欧氏距离。这正是本文所讨论的量。
协议。发布材料公布了两种评估协议。仓库配置将目标放在25帧之后,预算为50步;论文附录将其放在100帧之后,预算为150步。我们两者都报告,并始终以已发布运行为基线。以下每一次比较都与基线在同一随机种子下抽取相同情节,这一点我们通过复现抽取进行了验证。
计算。本文每个实验都在四核笔记本CPU上运行。未训练或微调任何模型。
## 3 预测器不是瓶颈
如果长时域规划失败是因为想象退化,那么退化应在展开中可见。我们让发布的检查点在真实验证片段上按记录的动作自回归展开,将每个想象潜在态与该帧编码器的真实潜在态比较,并与“什么也不动”的静态基线比较。
时域(规划器步)环境步想象误差/静态150.0665250.09010500.15215750.189*来自followup/rollout_h15_phase2_recal.txt。*
在十五个规划器步时,想象状态仍只有“世界冻结”假设的19%错误,且误差增长缓慢而平滑。在规划器可能需要的任何范围内都没有崩溃。
时域20根本无法测量。跨越三个历史帧和二十个预测器步(frameskip 5)的片段需要102个原始帧,而数据集的情节上限是101——这同样是复现§4.2中使偏移100协议退化的上限。
规划者从不要求这么多。使用时域5,它想象25个环境步,目标是100步之外。模型的看得比它被要求使用的远三倍。
## 4 目标饱和,然后反转
规划者的目标只有在潜在距离在其所需覆盖的范围内随真实距离上升时才有意义。我们直接测量了这一点,不涉及规划:渲染真实记录位置,编码它们,并比较成对潜在距离与成对真实距离。
真实距离(场地单位)对数平均潜在距离带内r0–2064815.920.66820–40128818.520.18240–60120819.680.11560–80132920.040.10480–10096020.610.122100–12073320.68−-0.029120–15069120.60下降150–30028319.93下降*来自followup/latent_metric_phase2_recal.txt,共7,140对。*
总体Pearson r = 0.426。由此得出三件事。
目标仅短程有效。二十个单位以内的带内相关为0.668,超过四十后低于0.13。
它饱和。在80–300单位间,均值变化为−-3.3%。两个状态,一个距目标八十单位,另一个三百单位,几乎得到相同的分数。
它反转。超过约一百二十个单位后,关系转为负值。最小化该代价的规划器可能被引导*远离*目标,并自我评分改善。
### 4.1 这正是观察到的失败
复现报告指出,偏移100的失败会过冲。重新分析其提交的情节数据:37次失败中有26次最终比起点更远离目标,中位数为原始间隔的1.41×\times。成功随距离下降,且恰好发生在度量失效的地方——60单位以下为100%,60到100之间为37%,100到140之间为6%。
饱和并最终反转的目标预测了这一切:短目标被解决,长目标不能,且规划者不只是停滞,而是自信地朝错误方向行进。
## 5 该病理属于方法本身,并解释了解离
### 5.1 作者自己的权重
对原作者发布的检查点——我们未训练过的权重——的相同测量:
PearsonSpearman80–300单调性80–300展幅作者发布0.3880.423否−-2.2%*来自followup/latent_metric_authors.txt。*
这几乎与我们检查点的病理完全一致。产生它的东西是方法自身的一个属性,而非重新实现选择。
### 5.2 度量质量决定长时域规划的排序
测量全部四个可用检查点,并将其与已发布的规划结果并排:
检查点单步误差偏移100,预算150Spearman80–300单调性80–300展幅Run 2 recal0.82940/50 = 80.0%0.872是+38.6%Run 0 recal—33/50 = 66.0%0.846是+34.9%phase2 recal0.11613/50 = 26.0%0.445否−-3.3%作者发布0.4107/50 = 14.0%0.423否−-2.2%长时域规划成功与度量质量精确地单调一致,并与单步预测精度单调相反。
这为复现报告但未解释的解离提供了机制。最准确的预测器是最差的长时域规划器,不是因为精度与规划无关,而是因为在这些运行中精度和度量可用性朝相反方向移动。按预测损失选择,就选掉了规划所依赖的几何。
### 5.3 相关物,而非原因
这种分裂与训练管线一致。两个几何可用的检查点都使用history_size1和action_dim2;两个病理性检查点——我们和作者的——都使用参考管线,即history_size3和密集十维动作。
有效秩也随之变化。复现所提交的探针记录:Run 0有效维度18.6,phase2为67.8,跨同一区间有3.6×\times的展幅,而度量恰好在该区间退化。这是对复现明确拒绝刻画之维度的部分解释:无论它们编码了什么,都与距离无关,并且稀释了覆盖全部192维的L2——这与二维线性读出从同一向量恢复位置(R²=0.99)而L2却无法排序一致。
我们无法分离这些因素。历史大小、动作宽度和像素归一化在这四个检查点间一起变化,且每个检查点都是单一种子。这是一个值得解释的对应关系,而非已证实的因果。
## 6 信息存在
如果嵌入不包含几何,任何目标都无法恢复它。但它包含。在350个渲染位置的冻结嵌入上拟合岭探针,并在150个保留位置上评估:
潜在L2解码位置对真实距离Pearson r0.4370.9897对真实距离单调否是80–300单位展幅+1.2%+73.4%探针R²0.9922,保留位置平均绝对误差1.72场地单位。*来自followup/probe_metric_phase2_recal.txt。*
作者检查点上也成立:探针R²=0.9627,解码位置距离单调,r=0.9573,而他们的潜在L2两者皆非。
编码器表示规划者所需的信息。目标函数将其丢弃。
## 7 修复
我们只改变规划者的目标,其他一切不变。编码器和预测器是发布的冻结权重。
解码位置代价。拟合从嵌入到位置的岭探针,并按解码位置之间的距离而非嵌入间距离对候选评分。探针在启动时基于渲染位置拟合。
学习型时间距离代价。解码位置代价依赖于TwoRoom恰好提供的东西——线性探针可读取的低维状态。为了测试修复是否依赖于此,我们从部署系统始终具有的唯一信号学习代价:两个观察帧相隔多少步。
训练对来自同一情节的真实记录帧,以其帧间隔为监督。一个小MLP将\((z_t, z_goal)\)映射到预测的到达所需步数,并在两种顺序上对称化。情节在训练和评估之间不相交分割。监督中不出现任何位置。
潜在L2学习型时间头部对真实空间距离Pearson r0.4840.819对真实距离单调否是80–150单位展幅+2.9%+43.3%保留情节上的MAE为12.80帧。*来自followup/temporal_head_phase2.txt。*
仅从时间间隔学习的代价在嵌入度量无法排序距离的地方做到了排序。修复不是TwoRoom具有可读状态的结果。
### 7.3 更好的目标并不是更精确的那个
时间头部预测空间距离*比*位置探针更差——r=0.819对比0.9897——但规划却更好:偏移100目标达98.0%,探针为88.0%(§8)。空间距离并非规划者所需的。
TwoRoom有一道带门的分隔墙,因此两个状态可能在空间上很近但在可达性上很远。我们测试了时间头部是否知道这一点:在真实空间距离上匹配成对,并按它们是否处于同一房间或跨墙分割:
真实距离对数同房/跨墙时间头部同房→\rightarrow跨墙比例潜在L2比例20–4062,142 / 21,71323.5→\rightarrow27.21.160.8740–6054,071 / 43,39735.1→\rightarrow45.21.290.9560–8036,724 / 51,27645.0→\rightarrow56.41.250.9980–10021,568 / 42,07554.5→\rightarrow68.91.261.02*来自followup/wall_reachability.txt,共460,320对。*
在匹配空间间隔下,时间头部穿越墙多收取24%的代价。平方潜在距离少收取4%——它不仅对墙视而不见,还略微偏向错误方向。
这恰好按三种目标的规划结果给它们排序:
目标跨墙/同房代价比偏移100平方潜在距离0.9626.0%解码位置按构造为1.0088.0%学习型时间头部1.2498.0%解码位置代价完全无法表示墙:无论障碍是否位于其间,位置之间的欧氏距离都相同。相似文章
为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势
本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。
@HaiyuWu1: 通过局部拉直潜在轨迹,可以大幅降低世界模型规划的优化难度!Sou…
该论文提出通过最大化相邻速度向量之间的余弦相似度来局部拉直潜在轨迹,以降低世界模型规划的优化难度。在PushT数据集上的实验表明,长程规划的成功率达到36%。
预测潜在世界模型的闭环性能:LunarLander中非马尔可夫奖励下MPC和基于模型的强化学习的离线检查点选择
本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。
Thoughts-as-Planning: 通过强化规划进行思维链优化的潜在世界模型
介绍了Thoughts-as-Planning框架,该框架使用潜在世界模型和强化学习将思维链优化建模为序列决策过程,在效率和泛化方面优于现有方法。
PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试
PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。