GAVEL:基于图世界模型的验证高效长时域LLM任务规划
摘要
本文介绍了GAVEL,这是一个使用图世界模型来验证和修复机器人任务长时域LLM规划的框架,显著提高了仿真中的成功率和效率。
查看缓存全文
缓存时间: 2026/09/21 15:22
论文页面 - GAVEL: 基于图世界模型的验证性高效长期LLM任务规划
来源: https://huggingface.co/papers/2609.19315
摘要
大型语言模型为长期机器人规划提供了灵活的接口,但生成的规划常常未能遵守实体约束、无法从规划错误中恢复,或在部分可观测环境下无法进行有效推理。我们提出了GAVEL,一个围绕显式图世界模型构建的、用于验证和修复长期LLM规划的框架。该图表示了相关的对象关系、行动的前提条件与影响,以及对未观测对象位置的概率信念。此模型可以在执行前预测LLM生成的行动后果,检测违规行为,并修复那些可以直接根据世界模型进行纠正的错误。该方法还将LLM重新规划仅保留用于需要语义推理的错误情况。对于多任务指令,GAVEL在可能的对象位置分布上进行推理,以重新排序剩余的子任务并最小化预期搜索成本。我们在BEHAVIOR-1K上评估了GAVEL,涵盖100个单长期任务和500个多任务指令。使用Qwen3-8B模型,GAVEL将单任务成功率从41.2%提升至91.8%,多任务成功率从19.9%提升至92.6%。分布信念推理还使得行驶距离相比静态变体减少了约5.4%。这些改进表明,显式图世界模型可以显著提升紧凑型及前沿托管LLM能力下长期实体规划的可靠性和效率。
查看arXiv页面 (https://arxiv.org/abs/2609.19315)查看PDF (https://arxiv.org/pdf/2609.19315)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.19315)
在你的代理工具中获取此论文:
hf papers read 2609\.19315
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型的README.md中引用arxiv.org/abs/2609.19315以从此页面链接它。
引用本文的数据集0
无数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2609.19315以从此页面链接它。
引用本文的Space0
无Space链接此论文
在Space的README.md中引用arxiv.org/abs/2609.19315以从此页面链接它。
包含本文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接它。
相似文章
GraphThink:面向长时程具身任务规划的图增强LLM思维
GraphThink 是一个将任务图与场景图相结合的框架,旨在增强基于LLM的长时程具身任务规划,在ALFRED基准上取得了最先进的结果,并提升了泛化能力和闭环重规划能力。
基于迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播
本文介绍了基于迭代语言规划(GILP),一种将小型参数化世界模型与基于LLM的推理相结合的方法,以减少LLM代理中的幻觉传播。实验表明,在图结构规划基准上,GILP将幻觉状态率从0.176降低到0.035,并将任务成功率从0.668提高到0.838。
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
τ_0-VLA:基于世界模型引导的测试时计算的分层机器人基础模型
分层视觉-语言-动作模型通过世界模型引导的测试时搜索扩展计算,用于高级子任务决策,从而提升长期机器人操作的性能。
GATS:基于图增强的树搜索与分层世界模型的高效智能体规划
GATS引入了一种基于图增强的树搜索与分层世界模型(符号型、学习型、生成型),消除了规划过程中的LLM调用,在合成任务和压力测试中实现了100%的成功率,优于LATS和ReAct。