AdvPlan-Bench:结构化规划生成智能体的对抗性评估

arXiv cs.LG 论文

摘要

AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。

arXiv:2608.00832v1 公告类型:新 摘要:结构化规划生成智能体通常被评价为仿佛计划本身就具有独立质量,然而许多现实规划任务需要考察当另一个智能体可以搜索响应时,某个候选方案会如何表现。我们提出了 AdvPlan-Bench,一个用于对抗性评估结构化规划生成智能体的离线基准。其贡献是一个通用的评估对象:带类型的计划、对抗性响应集、选择器诊断指标,以及可追踪的候选前沿指标。AdvPlan-Bench 将计划表示为带可选分支的类型化动作链,分配合成质量分数,使用 BLUE-vs-RED 优势和纳什差距诊断指标来比较对立的计划,并通过透明的启发式评分标准评估定性约束的一致性。在跨越五个规划模板的 150 个合成场景中,一个抽取八个响应候选的采样最佳响应策略将 BLUE 优势从 .518 降低到 .486,将 BLUE 胜率从 .900 降低到 .820(相对于单样本响应)。离线 LLM 策略合约基线达到 .496 的 BLUE 优势和 .700 的 BLUE 胜率,而两阶段多智能体委员会获得 .509 的 BLUE 优势和 .813 的 BLUE 胜率。一项基于 600 条评分记录的三评分者评分标准敏感性研究产生了 .978 的评分者间一致性。AdvPlan-Bench 不是一个可运行的规划器,也不提供关于现实世界决策质量的证据;它是一个可复现的基准工件,用于研究对抗性计划评估、响应预算敏感性、候选前沿以及多智能体批判与修订轨迹。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:43

# 结构化计划生成智能体的对抗性评估 arXiv 投稿
来源:https://arxiv.org/html/2608.00832
###### 摘要

结构化计划生成智能体通常以“计划孤立地具有质量”的假设进行评估,然而许多现实规划任务要求考虑候选计划在另一智能体能够搜索响应时的表现。我们引入 AdvPlan-Bench,一个用于结构化计划生成智能体对抗性评估的离线基准。其贡献是一个通用评估对象:一个类型化计划、一个对抗响应集、选择器诊断以及可追踪的候选前沿指标。AdvPlan-Bench 将计划表示为带可选分支的类型化动作链,赋予合成质量分数,通过 BLUE-对-RED 优势和纳什差距诊断来比较对立计划,并使用透明的启发式评分准则评估定性约束一致性。在跨越五个规划模板的 150 个合成场景中,一个抽取八个响应候选的采样最佳响应策略将 BLUE 优势从 .518 降至 .486,将 BLUE 胜率从 .900 降至 .820(相对于单样本响应)。一个离线 LLM 策略契约基线达到 .496 BLUE 优势和 .700 BLUE 胜率,而一个两阶段多智能体委员会获得 .509 BLUE 优势和 .813 BLUE 胜率。一项基于 600 条评分记录的三评分者评分准则敏感性研究产生 .978 的评分者间一致性。AdvPlan-Bench 不是一个实际运行规划器,也不提供关于真实世界决策质量的证据;它是一个可复现的基准工件,用于研究对抗性计划评估、响应预算敏感性、候选前沿和多智能体批评-修订痕迹。

代码和工件可在https://github.com/anote-ai/Research-COAGeneration获取。

## 1 引言

计划生成智能体通常根据它们是否产生合理的最终答案、有效的工具痕迹或可执行的动作序列来评估。然而,在对抗性设置中,候选计划并非孤立有意义。其表观强度取决于响应者如何搜索、哪些约束被强调、候选集是否包含有意义的替代方案,以及批评-修订是否改变所选计划。结构化响应规划是这一更广泛问题的紧凑测试平台:工件可检查、对手至关重要,而单一的标量成功指标可能掩盖重要权衡。

我们提出 AdvPlan-Bench,一个用于结构化计划生成智能体对抗性评估的离线基准。AI 贡献在于方法论:AdvPlan-Bench 将生成计划、对抗响应分布和多候选前沿转化为一个可复现的评估对象。当前基准刻意保持小型和合成化。它旨在使假设在进入更丰富的模拟、专家评分或实时模型支持的生成之前可检查。

该基准围绕当前智能体评估中的一个空白进行组织。许多智能体基准只询问智能体是否完成任务、调用正确工具或达成最终答案。对抗性计划生成则需要比较响应搜索下的*计划集合*。一个生成计划在孤立情况下可能在语法上有效且得分高,但一旦响应者采样合理的对抗计划就会变得脆弱。因此,AdvPlan-Bench 不仅评估最终计划质量,还评估响应预算敏感性、候选前沿结构、约束一致性诊断,以及为什么选择某个选项的痕迹级解释。

本文有三个贡献:

- •形式化的对抗性计划生成设置,其中结构化候选根据采样的响应集而非固定的答案键进行评估;
- •一个可复现的离线基准,包含类型化计划痕迹、BLUE/RED 策略比较、约束一致性诊断、响应预算曲线、候选多样性和帕累托前沿分析;以及
- •基于 150 个场景的经验证据,表明采样对抗响应、离线 LLM 策略契约基线和多智能体委员会生成会改变胜率与计划质量结论,并包括评分准则敏感性检查和基准开发发现:场景框架在被接入生成内容之前是一个静默的空操作。

范围边界是核心。AdvPlan-Bench 研究类型化合成计划工件和合成评估信号。它不实现实际运行决策架构,不使用真实运行数据,也不应用于真实世界规划决策。

## 2 相关工作

#### 基准设计。

通用评估工作如 [BIG-bench authors2023](https://arxiv.org/html/2608.00832#bib.bib2) 和 [HELM](https://arxiv.org/html/2608.00832#bib.bib8)(Liang 等人,2023)确立了广泛、透明、可复现测量的重要性。它们主要评估模型在任务和指标集合上的行为。AdvPlan-Bench 遵循同样的可复现原则,但聚焦于更窄的对象:对抗性计划生成,其中输入、候选集、对手响应集和选择痕迹都是基准实例的一部分。

#### 自博弈。

[AlphaZero](https://arxiv.org/html/2608.00832#bib.bib18)(Silver 等人,2018)、[AlphaStar](https://arxiv.org/html/2608.00832#bib.bib19)(Vinyals 等人,2019)和 [Pluribus](https://arxiv.org/html/2608.00832#bib.bib3)(Brown 和 Sandholm,2019)展示了自博弈在对抗性游戏中的价值。CICERO 将策略性自博弈扩展到自然语言谈判([Bakhtin 等人,2022](https://arxiv.org/html/2608.00832#bib.bib1))。AdvPlan-Bench 将自博弈用作评估机制,而非训练算法。

#### 对抗决策模型。

简化的竞争模拟和策略分析启发了轻量级对抗抽象([Lanchester, 1916](https://arxiv.org/html/2608.00832#bib.bib7);[Schelling, 1960](https://arxiv.org/html/2608.00832#bib.bib14))。AdvPlan-Bench 的模拟器检查刻意风格化,仅作为次要诊断报告。定性评分准则仅用作透明的约束一致性代理,不能替代专家评估。

#### 智能体评估。

[ReAct](https://arxiv.org/html/2608.00832#bib.bib22)(Yao 等人,2023b)推动了将推理和动作共同评估;[AgentBench](https://arxiv.org/html/2608.00832#bib.bib9)(Liu 等人,2024)在交互式设置中评估智能体。ALFWorld 将抽象文本推理与具身动作连接起来([Shridhar 等人,2021](https://arxiv.org/html/2608.00832#bib.bib17));WebArena 在真实网络环境中评估自主智能体([Zhou 等人,2024](https://arxiv.org/html/2608.00832#bib.bib25))。SWE-bench 将评估植根于可执行软件任务([Jimenez 等人,2024](https://arxiv.org/html/2608.00832#bib.bib4));τ-bench 和 ToolSandbox 在领域和对话环境中评估有状态工具使用智能体([Yao 等人,2024](https://arxiv.org/html/2608.00832#bib.bib20);[Lu 等人,2025](https://arxiv.org/html/2608.00832#bib.bib10))。AgentDiagnose 认为需要轨迹级诊断才能暴露最终成功掩盖的失败([Ou 等人,2025](https://arxiv.org/html/2608.00832#bib.bib12))。AdvPlan-Bench 贡献了一个更窄的工件:在对抗响应下对结构化计划生成策略进行配对评估,并带有面向计划比较(而非仅工具执行)的痕迹和候选集指标。

#### 规划与工具编排。

ACPBench 生成具有可验证答案的行动变化规划任务([Kokel 等人,2025](https://arxiv.org/html/2608.00832#bib.bib6));PlanningArena 在多个维度评估规划与工具学习([Zheng 等人,2025](https://arxiv.org/html/2608.00832#bib.bib24))。Toolformer 和 ToolLLM 研究语言模型的 API/工具使用([Schick 等人,2023](https://arxiv.org/html/2608.00832#bib.bib15);[Qin 等人,2024](https://arxiv.org/html/2608.00832#bib.bib13));LLMCompiler 和 SPIRAL 研究函数调用规划和反思性符号搜索([Kim 等人,2024](https://arxiv.org/html/2608.00832#bib.bib5);[Zhang 等人,2026](https://arxiv.org/html/2608.00832#bib.bib23))。Tree of Thoughts 在提交答案之前探索多条推理路径([Yao 等人,2023a](https://arxiv.org/html/2608.00832#bib.bib21));Self-Refine 和 Reflexion 表明反馈驱动的修订可改善智能体在测试时的输出([Madaan 等人,2023](https://arxiv.org/html/2608.00832#bib.bib11);[Shinn 等人,2023](https://arxiv.org/html/2608.00832#bib.bib16))。这些工作推动了智能体计划的可执行或结构化评估。AdvPlan-Bench 的不同之处在于将对抗响应本身作为评估单元的一部分:生成的计划是根据响应计划和候选前沿来评判,而不仅仅依据静态答案键。

#### AdvPlan-Bench 如何扩展这些项目。

相较于 BIG-bench 和 HELM 等广泛基准套件,主要改进不在于规模,而在于评估粒度:AdvPlan-Bench 将每个实例视为结构化对抗痕迹,而非提示-响应对。与 WebArena、ALFWorld、SWE-bench、τ-bench 和 ToolSandbox 相比,我们的基准将目标从任务完成或工具正确性转移到自适应对手下的稳健选项生成。与 Tree of Thoughts、Self-Refine、Reflexion 和 SPIRAL 相比,修订循环不只通过最终答案成功来评估;它还与明确的 RED 队压力、提案多样性、修订后多样性、稳健裕度和压力降低相关联。这为智能体规划研究创造了一个互补的基准设置:系统可以比较它们是否生成多样、可检查、经过对抗压力测试的计划,而不是仅仅生成貌似合理的推理痕迹。

#### 新颖性边界。

该基准不是新的自博弈学习算法、作战模型或通用规划器。其新颖性在于五个通常被单独评估的元素的受控组合:结构化计划工件、对抗最佳响应采样、多智能体提案与批评、启发式约束感知诊断,以及候选集的可复现痕迹级评估。匹配的单样本与采样响应比较隔离了对抗候选生成的效果,而框架空操作分析则说明了为什么基准变量必须与生成内容绑定后,关于敏感性或鲁棒性的主张才有意义。

## 3 问题形式化

设 \(s \in \mathcal{S}\) 为一个合成场景。BLUE 策略 \(\pi_B\) 生成结构化计划 \(c_B \in \mathcal{C}\);RED 策略 \(\pi_R\) 根据 \(s\) 以及可选的 \(c_B\) 生成响应。基准计算效用类优势信号 \(U(c_B, c_R, s)\)、约束启发诊断向量 \(D(c, s)\),以及候选集合属性(如多样性和帕累托前沿大小)。在单响应设置中,RED 采样一个 \(c_R\)。在采样最佳响应设置中,RED 采样 \(C_R = \{c_R^1, \ldots, c_R^k\}\) 并选择对抗得分最高的响应。核心评估问题是:当响应策略变得更加对抗性时,\(c_B\) 的表观质量是否稳定。

这不同于将生成计划与固定答案键进行比较的静态规划基准。这里,评估对象是元组 \((s, c_B, C_R, U, D)\):一个场景、一个结构化计划、一个对抗响应分布,以及解释为何选择某个候选的可检查痕迹。

对于多智能体计划生成,BLUE 提议智能体产生 \(B^0 = \{b_1, \ldots, b_m\}\),红队智能体为每个 \(b_i\) 产生响应集 \(R_i^0\)。裁决器首先计算:

\[
S(b_i) = \alpha Q(b_i) + \beta D(b_i) + \gamma V(b_i, B) - \rho P(b_i, R_i),
\quad (1)
\]

其中 \(Q\) 是重标定质量,\(D\) 是约束对齐,\(V\) 是候选多样性,\(P\) 是对抗压力。前 \(h=2\) 个候选进入审议轮。每个候选根据最强的 RED 批评进行修订,并附带缓解动作,产生 \(B^1\)。最终选择为:

\[
b^\star = \arg\max_{b \in B^0 \cup B^1} S(b)。
\quad (2)
\]

我们另外报告鲁棒裕度 \(M = S(b^\star) - \max_{b \in B^0} S(b)\)、压力缩减 \(\Delta P = \bar{P}_{\mathrm{shortlist}} - P(b^\star, R^\star)\),以及最终选定计划来自修订集的比例。这使基准成为一个关于提案、响应、批评、修复和选择的小型多智能体博弈,而不仅仅是对固定计划的成对评分。

## 4 基准

### 基准轴

AdvPlan-Bench 由六个基准轴定义,而非一个总分。第一,*表示有效性* 询问策略是否产生包含动作、链、分支、强制标签和目标的类型化计划对象,且下游评估者可检查。第二,*计划结构* 询问合成计划是否包含可选路径、简约事件结构和参与者世界线。第三,*对抗鲁棒性* 询问随着 RED 响应预算增加,BLUE 质量如何变化。第四,*前沿质量* 询问候选集是否包含多样且帕累托非支配的替代方案,而非冗余样本。第五,*约束敏感选择* 询问选择器是否可以在合成质量与定性结构之间进行权衡。第六,*痕迹可复现性* 询问每个表是否可以从每个场景的工件重新生成。

表 1:AdvPlan-Bench 基准轴与记录诊断。

### 表示

结构化计划包含目标、角色分配、领域标签、动作链、可选条件分支和可选工具调用。动作具有类别、目标、优先级和元数据。AdvPlan-Bench 使用动作链和条件分支作为轻量级图替代物:链边编码时间顺序,分支编码互斥实现路径,如路线选择、继续或撤退决策,或支援包备选方案。

每个计划获得合成质量分数

\[
q = w_e e - w_c c - w_r r,
\quad (3)
\]

其中 \(e\) 是有效性,\(c\) 是成本,\(r\) 是风险,默认权重为 \(w_e = .5\)、\(w_c = .3\)、\(w_r = .2\)。这是基准指标,而非资产效果匹配。

### 结构化计划诊断

动机性规划文献强调,好的候选计划应可行、资源感知、简约、参与者世界线完整,并明确行动的后果。AdvPlan-Bench 将其中一部分实现为透明软件诊断。路径可选性 \(O\) 是包含条件分支的链步骤的比例。顶点简约性 \(P_V\) 是唯一\((资产, 动作, 类别)\)事件签名与总事件签名的比率。世界线完成度 \(W\) 是动作既包含起始状态代理(如运输、部署、集结、准备、评估、扫描、侦察)又包含结束状态代理(如返回、撤退、保持、规避、重新部署、继续、支援、缓解)的资产比例。

这些诊断刻意采用保守代理。在当前运行中,种子 BLUE 计划的路径可选性为 .099,顶点简约性为 .571,世界线完

相似文章

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。