基于环境的LLM游戏智能体自动提示优化
摘要
介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。
arXiv:2606.17838v1 Announce Type: new
摘要:交互环境中的LLM智能体对其提示高度敏感,然而提示工程仍然是一个手动且特定于任务的过程。我们提出了一种针对LLM智能体的自动提示优化框架,该框架将观察-行动流水线分解为一个目标条件描述智能体和一个行动选择智能体,并通过LLM驱动的进化循环,在环境回报的引导下迭代优化每个模块的提示。我们引入了一个行为分析器,用于将回合结果归因于特定的提示组件,以及一个变异器,用于提出针对性的提示修改,然后通过环境运行进行验证。我们在BALROG基准测试中的所有五个BabyAI任务上进行了评估,将我们的流水线与BALROG的RobustCoTAgent在简单提示和引导提示初始化下进行了比较。优化后,所有任务和条件下的性能均有持续提升,且无需更新模型权重。在PutNext(一个多步协调任务,RobustCoTAgent的成功率为0%)上,我们的框架使用相同的底层LLM并通过优化提示,实现了高达72.5%的成功率。这些结果表明,多智能体框架结合自动提示优化能够增强LLM,而无需进行微调或大量人工监督。
查看缓存全文
缓存时间: 2026/06/17 05:42
# 面向环境交互的LLM游戏代理自动提示优化 来源:https://arxiv.org/html/2606.17838 Rean Clive Fernandes 多特蒙德工业大学 Lamarr机器学习和人工智能研究所 &Lukas Fehring 莱布尼茨汉诺威大学 &Theresa Eimer 莱布尼茨汉诺威大学 &Marius Lindauer L3S研究中心 莱布尼茨汉诺威大学 &Matthias Feurer Lamarr机器学习和人工智能研究所 多特蒙德工业大学 ###### 摘要 LLM代理在交互环境中对其提示高度敏感,但提示工程仍然是手动且依赖特定任务的过程。我们提出了一种面向LLM代理的自动提示优化框架,该框架将“观察到行动”的管道分解为**目标条件描述代理**和**行动选择代理**,并通过由环境奖励引导的LLM驱动演化循环迭代优化每个模块的提示。我们提出了一个**行为分析器**,用于将情节结果归因于特定的提示组件,以及一个**变异器**,用于提出针对性的提示修改建议,然后通过环境 rollout 进行验证。我们在BALROG基准测试的所有五个BabyAI任务上进行了评估,在普通提示初始化和引导提示初始化下,将我们的管道与BALROG的RobustCoTAgent进行了比较。优化在各项任务和条件下均一致地提升了性能,且无需更新模型权重。在PutNext这个多步骤协调任务上,RobustCoTAgent的成功率为0%,而我们的框架使用相同的底层LLM和优化后的提示,达到了高达72.5%的成功率。这些结果表明,多代理框架结合自动提示优化,无需微调或大量人工监督即可增强LLM的能力。 ## 1 引言 LLM已展现出作为通用推理引擎的卓越能力,近期工作正推动LLM成为具身AI代理在决策场景中的骨干(plaat25survey; gao2026tmlr-survey)。交互式游戏是测试所需能力的有趣试验场(paglieri2025BALROG; pokeagent2026),包括长期规划、部分信息下的决策以及适应环境变化。虽然当前的LLM可以解决简单的游戏任务,但它们仍达不到人类水平,始终难以解释空间信息(paglieri2025BALROG),并且可能被领域特定的机器学习解决方案(如强化学习(RL; pokeagent2026))击败。手工制作、任务特定的代理架构(Zhang2025GeneralMH; harnessengineeringblog2026)已被证明可以提升性能,但它们必须针对每个新领域进行手动调整。相反,近期工作通过手工制作、领域特定的提示获得了改进的性能(lou2026learning)。 图1:我们的方法包含两个组件:标准强化学习循环(顶部)和演化式提示优化(底部,简化,未显示提示评估)。观察、行动和奖励以文本形式传递。actor可以是任何基于语言模型的代理系统。在本文中,我们使用一个链式描述代理和行动代理。在这项工作中,我们超越了单一代理,即一个代理必须在每个步骤处理多个任务,如状态解析、策略调整和行动选择。我们将此负载分布在多个代理之间;这是一种提升LLM能力的成熟技术(he-icml24a)。具体而言,我们将单一代理分解为描述代理 \(A_{des}\) 和行动选择器 \(A_{sel}\),类似于RL中的actor-critic分离(grondman12acsurvey)。描述代理 \(A_{des}\) 仅专注于从当前状态中提取任务相关信息,而无需承担提前规划的额外负担。然后,此描述作为下一步行动的基础。这种设置要求代理的提示能够共同发挥作用,从而加剧了提示工程的挑战。我们的目标是自动获得这些提示,无需人工努力。我们使用简单的LLM驱动演化算法(meyerson-language-model-crossover)根据任务反馈优化两个子代理,产生一种任务特定的提示结构,通过分离状态解释和规划来提升性能。这种通用的代理架构结合提示优化,提供了一种新颖且自动化的方式,使LLM代理适应新任务,无需昂贵的梯度更新或任务特定的重新设计。我们在BALROG(paglieri2025BALROG)的所有五个BabyAI任务上进行了评估,该基准提供高级自然语言任务描述以及逐步观察和奖励。总之,我们的贡献如下:(i)一个用于LLM代理的自动提示优化框架,允许优化单一代理以及具有多个子代理的代理;(ii)一种基于情节回报以及代理输出和状态转换行为分析的联合提示优化过程;(iii)通过在BALROG基准(一个多回合网格世界基准)的BabyAI任务上进行分解和优化,提升了性能。我们的管道代码可在https://github.com/ReanFernandes/rapoa获得。 ## 2 相关工作 **作为代理的LLM。** 鉴于LLM在语言任务(如问答和摘要)上的成功,下一步自然是将它们用于复杂、多步骤的决策任务。为了测试这些能力,最近的基准涵盖了科学发现(lu24aiscientist; xu26medagentgym)、机器学习和编码(pan24swegym; nathani25mlgym)以及游戏(klissarov25survey; paglieri2025BALROG; pokeagent2026)。为了帮助解决此类任务,人们开发了自我批评方法,使用来自环境或代理本身的反馈(yao2022react; shinn2023reflexion; kim24computertasks)。我们的工作继续建立在这一研究方向的基础上,重点放在行动选择机制上。先前的工作也在基于文本的RL环境中应用权重更新(carta2023glam; wen24reinforcingla; zhai24finetuning),但LLM微调成本高昂。不需要访问权重,提示优化可以同时应用于开放和封闭权重模型。 **代理架构。** 近期工作表明,为解决决策任务施加预定义结构(例如,分离记忆和技能组件)可以显著提升性能(plaat25survey)。he-icml24a定义了一个规划器-行动器-报告器框架,其中规划器维持一个包含子目标的长期计划供行动器实现。报告器向规划器总结进度。wang23planning使用类似的结构进行基于LLM的规划。Zhang2025GeneralMH证实,这种原则性的LLM代理高层分解是游戏成功的关键因素。zhou25ma甚至优化了多代理系统中不同代理的理想组合。我们的方法在很大程度上与这些架构正交,因为我们专注于集成提示优化。原则上,我们的方法可以与许多代理设计相结合。 **自动提示优化。** 优化提示而非权重是使LLM适应新任务的一种替代方式。APE(zhou2022large)建立了在给定性能指标的情况下可以自动优化提示的观点。APO/ProTeGi(pryzant2023automatic)引入了文本梯度,其中LLM分析失败案例并以纠正方向编辑提示。OPRO(yang2023large)将LLM视为一个黑盒优化器,接收(提示、分数)对的历史并推断下一步尝试什么。GEPA(agrawal2025gepa)表明,在系统级轨迹上进行反思性提示演化可以匹配或超越通过LLM微调进行的权重更新。虽然问题设置讨论了一个多代理设置,但实验并未包含这样的设置。所有这些方法都在固定数据集上进行评估,将优化后的提示与数据集质量和覆盖范围紧密耦合。从技术上讲,也可以优化由另一个LLM判断的量,例如风格(baumann-aec24a),但这可能由于LLM作为法官模型而导致偏差(dorner-llmasjudge)。我们的方法用环境奖励作为优化信号代替了静态数据集,环境奖励是非平稳的,更难被同样方式过拟合。RePrompt(chen2024reprompt)与我们的设置类似,它使用LLM生成的即时奖励,而不是依赖最终解决方案检查器。然而,它旨在用于非交互式设置,因此无法考虑环境反馈。 **面向LLM代理的提示优化。** 近期工作关注于改进作为代理的LLM,例如,通过促进失败归因。liang24reflection和yang2026evotool都使用代理分解来精确定位失败轨迹的责任。AgentTracer(zhang2025agentracer)形式化了多代理系统中的失败归因,将决定性错误定义为轨迹中最早的行动,其纠正足以改变结果。这两个工作都为我们的行为分析器模块提供了信息。几种方法专注于从收集的经验中提取规则或指导,以改进未来的交互(zhao2024expel; chen24automanual; gokhale25logicguard)。我们认为这可以作为安全关键设置中的一个良好解决方案,但比优化良好的提示更具局限性。另一个相关但正交的想法是优化的元提示,可以提供环境描述、策略建议和解决方案思路(xiong25mpo; lou2026learning)。我们在单个决策层面上补充了这一想法。 ## 3 问题设置 我们的目标是将LLM用作多种、潜在长期任务中的决策者。我们将此设置形式化为部分可观察马尔可夫决策过程(POMDP)(kaelbling-ai98a)\((S, A, O, T, Z, R, \gamma)\),遵循标准RL公式。这里,\(S\)、\(A\)和\(O\)分别表示状态、行动和观察空间;\(T: S \times A \to S\)、\(Z: S \times A \to O\)和\(R: S \times A \to \mathbb{R}\)分别是转移、观察和奖励函数;\(\gamma \in [0,1]\)是折扣因子。在这项工作中,我们仅考虑基于LLM的代理。代理 \(\pi: O \to A\) 可以实例化为由单个提示控制的单一代理,也可以实例化为一个多代理系统。形式上,我们将多代理系统定义为一个有向无环图 \(\{A, E^A\}\),其中 \(A = (A_1, ..., A_n)\) 是由子代理实例化的节点,\(E^A \in \{0,1\}^n\) 是描述代理间通信的矩阵。\(E^A_{i,j}=1\) 当且仅当 \(A_i\) 向 \(A_j\) 发送消息,否则 \(E^A_{i,j}=0\)。每个子代理 \(A_i\) 由其自己的提示 \(p_i\) 指导,我们将所有提示的列表记为 \(P = (p_1, \ldots, p_{|A|})\)。在每一步 \(t\),代理系统 \(\pi^P\) 接收观察 \(o_t \in O\),并根据策略 \(\pi^p\)(以交互历史 \(h_t = (o_0, a_0, \ldots, o_t)\) 和提示 \(P\) 为条件)选择行动 \(a_t \sim \pi^P(\cdot \mid h_t)\)。¹所选行动通过 \(T\) 驱动状态转移,通过 \(Z\) 生成新观察,并通过 \(R\) 产生奖励,从而生成轨迹 \(\tau = (o_0, a_0, r_0, o_1, a_1, r_1, \dots)\)。目标是最大化期望折扣回报 \(J(\pi^P) = \mathbb{E}_{\pi^P}\left[\sum_{t=0}^{\infty} \gamma^t R(s_t, a_t)\right]\)。本文的目标是为给定的代理架构找到最大化此期望回报的提示集合 \(P^*\): \[ P^* \in \operatorname*{arg\,max}_{P} J(\pi^P). \tag{1}\] 在这个**交互式提示优化**(IPO)设置中,我们不考虑使用梯度更新模型权重以获得参数化策略的方法(sutton-rlbook; wen24reinforcingla; zhai24finetuning)。相反,我们针对固定架构 \(\{A, E^A\}\) 优化提示 \(P\) 以最大化期望回报。因此,优化问题从参数空间转移到了提示空间。 ## 4 面向代理系统的奖励驱动自动提示优化 我们提出的方法 **面向代理系统的奖励驱动自动提示优化**(RAPOA)由一个基于LLM的代理和一个自动提示演化循环组成,如图1所示。我们交替进行两个阶段:在第一阶段,代理和基于文本的环境形成一个标准强化学习循环。在第二阶段,优化器评估聚合的情节,识别失败案例和低效问题,并构建修正后的提示。通过这种方法,我们实现了任务特定优化提示的自动构建。初始化期间和优化期间使用的所有提示见附录C。 输入:初始代理 \(\pi^P\)(由带有提示 \(P\) 的子代理 \(A\) 组成),预算 \(N\),阈值 \(\delta\),优化和选择rollout数量 \(k_{opt}\) 和 \(k_{sel}\),要分析的轨迹数量 \(l\) \(S_{\mathrm{select}} \leftarrow \textsc{GenerateSeeds}(k_{sel})\) // 保留,在整个运行过程中固定 \(T_{\mathrm{select}}^A \leftarrow \textsc{Rollout}(\pi, S_{\mathrm{select}})\) // 从rollout收集情节 1 \(A' \leftarrow \emptyset\) 2 while 预算 \(N\) 未耗尽 do \(S_{\mathrm{sample}} \leftarrow S_{\mathrm{opt}} \leftarrow \textsc{GenerateSeeds}(k_{opt})\) // 每个外部迭代使用新的种子 3 \(T_{\mathrm{sample}}^A \leftarrow \textsc{Rollout}(\pi, S_{\mathrm{sample}})\) // 从rollout收集情节 4 while \(|S_{\mathrm{sample}}| \neq 0 \And A \neq A'\) do \(S_{\mathrm{cand}}, T_{\mathrm{cand}} \leftarrow \textsc{Sample}(S_{\mathrm{sample}}, T_{\mathrm{sample}}, l)\) // 两者同时采样 5 \(S_{\mathrm{sample}} \leftarrow S_{\mathrm{sample}} \setminus S_{\mathrm{cand}}\) 6 \(T_{\mathrm{sample}}^{A'} \leftarrow T_{\mathrm{sample}}^{A'} \setminus T_{\mathrm{cand}}^{A'}\) \(L \leftarrow \textsc{BehaviorAnalyzer}(A, T_{\mathrm{cand}})\) // 优先处理的(问题,代理)列表 7 for each \((\mathit{issue}, A_i) \in L\) in order of severity do 8 \(A_i' \leftarrow \textsc{AdaptSubagent}(A_i, \mathit{issue}, T_{\mathrm{cand}})\) 9 \(A' \leftarrow A\) with subagent \(A_i\) replaced by \(A_i'\) 10 if \(\textsc{Evaluate}(S_{\mathrm{opt}}, A') > \textsc{Evaluate}(S_{\mathrm{opt}}, A) + \delta\)相似文章
EEVEE:面向现实世界中自改进代理的测试时提示学习
EEVEE是一种新颖的测试时提示学习框架,专为LLM代理设计,通过任务聚类和共同演化的路由器-提示优化来处理异构数据流,在多个基准测试上实现了显著优于现有方法的改进。
AGORA: 基于适配器的观测-动作保留——用于LLM代理的无推理提示压缩
AGORA 引入了一种用于LLM代理的无推理步骤级提示压缩器,避免了令牌级压缩器的'动作语法破坏'失效模式。它通过结构解析器、始终保留底限以及学习的相关性评分器,在9个环境中的8个(跨骨干网络)保留了≥75%的未压缩性能。
GEPA:反思式提示演化可超越强化学习
GEPA 是一款提示优化器,利用自然语言反思从试错中学习,在多个任务中,以多达 35 倍的更少 rollout 次数超越了 GRPO 和 MIPROv2 等强化学习方法。
SePO:用于系统提示优化的自进化提示智能体
SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。
SAGE:基于智能体引导的随机提示优化
介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。