RISE:世界动作模型中的自适应想象框架
摘要
RISE引入了一种自适应框架,用于世界动作模型中的想象推演,通过反事实驾驶数据集提高规划性能并减少不必要的计算。
查看缓存全文
缓存时间: 2026/08/25 04:34
论文页面 - RISE:面向世界动作模型的自适应想象
来源:https://huggingface.co/papers/2608.20430
摘要
RISE 通过权衡预期收益与成本,自适应地决定在规划时是继续还是停止想象展开过程,该研究得到一个带有专家标注的反事实驾驶数据集支持。
世界动作模型(https://huggingface.co/papers?q=World%20Action%20Models)(WAMs)通过将未来世界演变融入动作生成来改进规划,但现有方法为每个场景分配固定的想象预算。我们提出 RISE(通过选择性展开来优化想象),一个系统级的自适应想象(https://huggingface.co/papers?q=adaptive%20imagination)框架,根据继续展开的预期规划收益来做出顺序化的展开/停止(https://huggingface.co/papers?q=Roll%2FStop%20decisions)决策。在每个步骤中,一个潜在评估器(https://huggingface.co/papers?q=Latent%20Evaluator)估计当前前缀所揭示的风险,以及如果想象继续进行,规划可能改善的程度;而一个展开门(https://huggingface.co/papers?q=Rollout%20Gate)则权衡这一预期收益与额外的计算成本。由于真实的驾驶日志只暴露一个已实现的未来,我们进一步构建了 CounterDrive(https://huggingface.co/papers?q=CounterDrive),这是一个具有多样化结果和风险水平的反事实数据集(https://huggingface.co/papers?q=counterfactual%20dataset),以丰富未来动态并提供局部的风险监督(https://huggingface.co/papers?q=risk%20supervision)。每个保留的样本都经过专家验证,并标注轨迹有效性、事件起始点和因果类别,为安全关键的世界建模研究提供了可重复利用的资源。在 NAVSIM(https://huggingface.co/papers?q=NAVSIM)和 nuScenes(https://huggingface.co/papers?q=nuScenes)上的实验表明,RISE 在减少不必要展开的同时,实现了最佳的整体规划性能,额外的迁移结果支持了其在 WAM 架构中的即插即用通用性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.20430)查看 PDF (https://arxiv.org/pdf/2608.20430)项目页面 (https://cowarobot-ai.github.io/RISE/)GitHub20 (https://github.com/COOWAI/RISE)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.20430)
获取本论文的代理版本:
hf papers read 2608\.20430
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文 在模型的 README.md 中引用 arxiv.org/abs/2608.20430 以从此页面链接。
引用本文的数据集0
无数据集链接本文 在数据集的 README.md 中引用 arxiv.org/abs/2608.20430 以从此页面链接。
引用本文的 Space0
无 Space 链接本文 在 Space 的 README.md 中引用 arxiv.org/abs/2608.20430 以从此页面链接。
包含本文的收藏集0
无收藏集包含本文 将本文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
世界-动作交互模型的DAWN
本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。
何时信任想象:世界行动模型的自适应动作执行
本文介绍了 FFDC,一种用于世界行动模型的轻量级验证器,它通过检查预测观察与实际观察之间的一致性,实现了自适应动作块大小,从而提高了机器人操作的效率和鲁棒性。
世界行动模型:具身智能的下一个前沿
本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。
Reason--Imagine--Act:基于世界模型的闭环大语言模型决策在自动驾驶中的应用
提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。
未见先觉:世界行动模型的潜在未来
提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。