GAVEL:基于图世界模型的验证高效长时域LLM任务规划

Hugging Face Daily Papers 论文

摘要

本文介绍了GAVEL,这是一个使用图世界模型来验证和修复机器人任务长时域LLM规划的框架,显著提高了仿真中的成功率和效率。

大型语言模型(LLMs)为长期机器人规划提供了灵活的接口,但生成的规划往往无法遵守具身约束、从规划错误中恢复,或在部分可观测性下有效推理。我们提出了GAVEL,这是一个用于验证和修复长期LLM规划的框架,围绕一个显式图世界模型构建。该图表示相关的物体关系、动作前提和效果,以及对未观测物体位置的概率信念。该模型可以在执行前预测LLM生成动作的后果,检测违规行为,并修复那些可以直接从世界模型中纠正的错误。这种方法还将LLM重新规划仅保留给需要语义推理的错误。对于多任务指令,GAVEL在可能的物体位置分布上进行推理,以重新排列剩余子任务并最小化预期搜索成本。我们在BEHAVIOR-1K上评估了GAVEL,涵盖了100个单一长期任务和500个多任务指令。使用Qwen3-8B,GAVEL将单一任务成功率从41.2%提高到91.8%,多任务成功率从19.9%提高到92.6%。分布信念推理还将行程距离减少了约5.4%,与静态变体相比。这些改进表明,一个显式图世界模型工具可以显著提高长期具身规划的可靠性和效率,适用于紧凑型和前沿托管的LLM能力。
查看原文
查看缓存全文

缓存时间: 2026/09/21 15:22

论文页面 - GAVEL: 基于图世界模型的验证性高效长期LLM任务规划

来源: https://huggingface.co/papers/2609.19315

摘要

大型语言模型为长期机器人规划提供了灵活的接口,但生成的规划常常未能遵守实体约束、无法从规划错误中恢复,或在部分可观测环境下无法进行有效推理。我们提出了GAVEL,一个围绕显式图世界模型构建的、用于验证和修复长期LLM规划的框架。该图表示了相关的对象关系、行动的前提条件与影响,以及对未观测对象位置的概率信念。此模型可以在执行前预测LLM生成的行动后果,检测违规行为,并修复那些可以直接根据世界模型进行纠正的错误。该方法还将LLM重新规划仅保留用于需要语义推理的错误情况。对于多任务指令,GAVEL在可能的对象位置分布上进行推理,以重新排序剩余的子任务并最小化预期搜索成本。我们在BEHAVIOR-1K上评估了GAVEL,涵盖100个单长期任务和500个多任务指令。使用Qwen3-8B模型,GAVEL将单任务成功率从41.2%提升至91.8%,多任务成功率从19.9%提升至92.6%。分布信念推理还使得行驶距离相比静态变体减少了约5.4%。这些改进表明,显式图世界模型可以显著提升紧凑型及前沿托管LLM能力下长期实体规划的可靠性和效率。

查看arXiv页面 (https://arxiv.org/abs/2609.19315)查看PDF (https://arxiv.org/pdf/2609.19315)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.19315)

在你的代理工具中获取此论文:

hf papers read 2609\.19315

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接此论文

在模型的README.md中引用arxiv.org/abs/2609.19315以从此页面链接它。

引用本文的数据集0

无数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2609.19315以从此页面链接它。

引用本文的Space0

无Space链接此论文

在Space的README.md中引用arxiv.org/abs/2609.19315以从此页面链接它。

包含本文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接它。

相似文章