ACID:通过逆动力学实现世界模型规划中的动作一致性
摘要
本文提出ACID方法,通过逆动力学模型引入循环动作一致性,增强世界模型中的决策时间规划,确保预测的可实现性,并在多个任务中以更少的计算量提升规划效率。
查看缓存全文
缓存时间: 2026/07/07 18:45
论文页面 - ACID:通过逆动力学实现动作一致性以进行世界模型规划
来源:https://huggingface.co/papers/2607.02403
https://huggingface.co/papers/2607.02403#tldr总结
决策时规划仅根据候选方案的最终预测状态与目标的接近程度来评分,而从不检查到达目标的路径是否真正可行。ACID 增加了循环动作一致性:逆动力学模型推断每个预测转移背后的动作,其与条件化动作之间的不匹配成为每一步的规划成本——从而在四个世界模型和六个任务上改进规划,同时大幅降低计算量。
https://huggingface.co/papers/2607.02403#overall-architecture-of-acidACID 的整体架构
(左图):使用动作条件化世界模型的决策时规划:采用带有 CEM 的 MPC 在候选动作序列 a0:H−1 上搜索,以最小化增强后的规划成本。当前观测 o0 由编码器 Eθ 编码为 z0,世界模型 Fθ 从 (z0, a0:H−1) 展开潜变量轨迹 ẑ1:H。逆动力学模型 Gφ 接收每个预测转移 (ẑt, ẑt+1) 并推断能够解释该转移的动作 ât。(右图):增强后的规划成本包含两个项:目标成本,偏好预测最终潜变量接近目标的候选动作序列;以及动作一致性成本,偏好预测轨迹在环境中可实现的候选动作序列。
相似文章
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
世界-动作交互模型的DAWN
本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。
何时信任想象:世界行动模型的自适应动作执行
本文介绍了 FFDC,一种用于世界行动模型的轻量级验证器,它通过检查预测观察与实际观察之间的一致性,实现了自适应动作块大小,从而提高了机器人操作的效率和鲁棒性。
Thoughts-as-Planning: 通过强化规划进行思维链优化的潜在世界模型
介绍了Thoughts-as-Planning框架,该框架使用潜在世界模型和强化学习将思维链优化建模为序列决策过程,在效率和泛化方面优于现有方法。
基于潜世界模型的强化规划
本文介绍了强化规划,一种利用潜世界模型学习改进多步骤规划的方法,在视觉导航和机器人操作等任务中取得了近乎完美的成功率,并且效率显著高于手工设计的算法。