AdaPlanBench:在世界和用户约束下评估大型语言模型智能体的自适应规划能力

Hugging Face Daily Papers 论文

摘要

AdaPlanBench是一个动态基准测试,用于评估LLM智能体在多轮交互中根据逐步显现的世界和用户约束进行自适应规划的能力。实验表明,当前模型尤其难以应对用户约束。

在现实世界问题中,语言模型的规划往往涉及世界约束和用户约束,这些约束可能不会一开始就完全明确,而是通过交互逐步揭示。然而,现有的基准测试并未充分探索在逐步揭示的双重约束下的自适应规划。为填补这一空白,我们提出了AdaPlanBench,这是一个动态交互式基准测试,用于评估大型语言模型(LLM)智能体是否能在逐步揭示的世界和用户约束下自适应地规划与重新规划。AdaPlanBench基于307个家务任务构建,并配备了一个可扩展的约束构建流程,为每个任务添加双重约束。在运行时,智能体通过多轮协议与环境交互:只有当智能体提出的计划违反隐藏约束时,这些约束才会被揭示,从而要求智能体在累积反馈中迭代修改计划。这使得规划变得极具挑战性,因为智能体必须从反馈中推断并追踪约束,同时有效地重新规划。对十种主流LLM的实验表明,在双重约束下的自适应规划仍然困难重重,最佳模型仅能达到67.75%的准确率。我们进一步观察到,随着约束的累积,性能逐渐下降,用户约束尤其构成巨大挑战,而失败往往源于较弱的物理基础理解以及有效性降低。这些结果将AdaPlanBench确立为双重约束交互规划的测试平台,并凸显了LLM智能体在面对动态揭示的约束时实现可靠适应的挑战。
查看原文
查看缓存全文

缓存时间: 2026/06/05 06:06

论文页面 - AdaPlanBench:评估大语言模型智能体在世界与用户约束下的自适应规划能力

来源:https://huggingface.co/papers/2606.05622

摘要

AdaPlanBench 是一个动态交互式基准,用于评估大语言模型智能体在多轮交互过程中,面对逐步揭示的世界约束和用户约束时进行自适应规划的能力。

语言模型在现实世界问题中的规划通常同时涉及世界约束和用户约束,而这些约束可能不会在初始阶段完全明确,而是通过交互逐步披露。然而,现有基准对在逐步揭示的双重约束条件下的自适应规划探索仍然不足。为填补这一空白,我们提出了 AdaPlanBench——一个动态交互式基准,用于评估大语言模型 (LLM) 智能体能否在逐步揭示的世界约束和用户约束下进行自适应规划与重新规划。AdaPlanBench 基于 307 个家庭任务构建,并采用可扩展的约束构建流水线,为每个任务添加双重约束。在运行时,智能体通过多轮协议与环境交互,只有当智能体提出违反隐藏约束的计划时,这些约束才会被揭示,从而要求智能体在累积反馈下进行迭代的计划修订。这使得规划任务极具挑战性,因为智能体必须从反馈中推断并跟踪约束,同时进行有效的重新规划。对十个领先 LLM 的实验表明,在双重约束下进行自适应规划仍然困难,最佳模型仅达到 67.75% 的准确率。我们进一步观察到,随着约束累积,性能下降,其中用户约束构成特别大的挑战,而失败往往源于较弱的物理基础和效果降低。这些结果使 AdaPlanBench 成为双重约束交互式规划的测试平台,并凸显了 LLM 智能体在面对动态揭示的约束时实现可靠适应的挑战。

查看 arXiv 页面 (https://arxiv.org/abs/2606.05622)
查看 PDF (https://arxiv.org/pdf/2606.05622)
GitHub (https://github.com/JiayuJeff/AdaPlanBench)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05622)

在您的智能体中获取此论文:

hf papers read 2606\.05622

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.05622 以从此页面链接。

引用此论文的数据集1

JiayuJeff/AdaPlanBench 更新于约 3 小时前 • 6 • 1 (https://huggingface.co/datasets/JiayuJeff/AdaPlanBench)

引用此论文的 Space0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.05622 以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。

APeB:大型语言模型智能体个性化能力的基准测试

arXiv cs.AI

提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。