超越记忆中的世界:面向演化场景下持久导航的预测性4D信念
摘要
论文提出EvolvingNav,一个面向具身智能体的预测性4D信念框架,用于在不断演化的环境中追踪目标、在检查时刻预测其位置,并在可见性受限时修正信念;同时提出EvoWorld-Bench基准,涵盖54个场景和803,680个任务,模拟实验与真实机器人实验均表明该方法提升了导航成功率。
查看缓存全文
缓存时间: 2026/10/01 12:23
论文页面 - 超越记忆中的世界:面向演化世界中持久导航的预测性4D信念
来源:https://huggingface.co/papers/2609.39166
摘要
持久空间记忆使具身智能体能够在重复访问中导航熟悉环境。然而,目标可能在未被观测期间发生移动(包括导航过程中),导致智能体到达时记忆中的位置已不可靠。尽管记忆检索和状态预测已有进展,如何处理世界持续隐藏的演化、以及在有限可见性下修正信念仍然充满挑战。我们研究演化世界导航(Evolving-World Navigation)问题,其中智能体需从间歇性的观测中推断目标位置、预测其在检索时刻的状态,并利用视觉证据修正信念。我们提出EvolvingNav,它通过一个结构化的“持续-重定位“模型,从带时间戳的3D物体历史中构建时间索引的信念。该信念区分了目标“停留在最后观测位置“与“重定位到其他位置“两种情况,并在已知候选集之外保留概率质量。一个事件驱动的滤波器随时间推移传播当前信念,预测目标在候选检索时刻的占用情况,并融入新的RGB-D证据。负面观测会依据经过校准的、与可见性相关的检测概率对位置假设进行降权,同时证据跟踪机制防止重复使用相同观测。一个冻结的、零样本视觉-语言控制器利用更新后的信念来选择动作并重新规划。我们进一步提出了EvoWorld-Bench,一个基于人类活动轨迹构建的基准,包含54个场景和803,680个任务,其中在导航前和导航过程中都设有受控的变化。在仿真和真实机器人实验中,EvolvingNav相比所评估的基线方法提升了导航成功率和搜索效率。配对实验表明,在可学习的时间模式下增益最为显著,而消融实验则验证了保留不确定性以及纳入可见性感知证据的价值。
查看 arXiv 页面 (https://arxiv.org/abs/2609.39166) 查看 PDF (https://arxiv.org/pdf/2609.39166) 项目页面 (https://zju4embodiedai.github.io/EvolvingNav/) GitHub 0 (https://github.com/ZJU4EmbodiedAI/EvolvingNav) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.39166)
在你的智能体中获取此论文:
hf papers read 2609.39166
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.39166,即可从此页面链接到该论文。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.39166,即可从此页面链接到该论文。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.39166,即可从此页面链接到该论文。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
部分可观测环境中的生成模型预测规划导航
本文介绍了BeliefDiffusion,一种结合扩散模型表示多模态信念分布和使用模型预测控制在部分可观测环境中进行规划的框架,相比基线方法取得了更好的导航成功率和路径效率。
NavHarness:迈向终身具身导航
论文提出了 NavHarness——一种免训练的具身导航框架(harness),将记忆处理融入导航循环,使智能体能够在不同会话之间携带经验,实现终身导航。在 GOAT-Bench 上,相比仅依赖上下文的独立会话,该方法将成功率最高提升 22.6 个百分点,并借助 GPT-6/Astra 达到当前最优结果。
Embodied-Navigator:指点、思考、记忆与对齐以实现高效导航
TAMP-Nav 是一个统一框架,通过将视觉语言模型与二维视觉提示对齐、使用压缩记忆的选择性推理以及策略优化来增强具身导航,实现了最先进的性能,并具有高运行时和样本效率。
使用潜空间世界模型预测后果并强化导航策略
本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。
架构基础模型至物理世界智能体,推动长时程导航的前沿
NavMCP是一个代理脚手架框架,集成视觉语言模型与导航基础模型,以实现持久的长时程物理世界探索,并在基准测试和真实机器人任务中取得最先进的成果。