MOAE:多目标智能体进化的帕累托保留搜索
摘要
MOAE 提出了一种帕累托保留的进化搜索方法,能够在搜索过程中无需固定标量化,同时优化 LLM 代理的多个目标,包括任务性能、轨迹质量和安全性。
arXiv:2609.05992v1 公告类型:新
摘要:随着基于 LLM 的代理不断发展,其评估已变得日益多维:一个能力强大的代理不仅要实现高任务完成精度,还要在交互质量、安全性和效率方面表现出色,这引发了一个核心问题:这些目标能否同时优化?现有方法考虑了多个目标,但许多方法将异构测量合并为固定的标量分数。这种标量化依赖于指标归一化和偏好权重,可能会丢弃代表有用部署权衡的候选方案。我们引入多目标代理进化(MOAE),将迭代式上下文内优化组织为对完整代理轨迹的帕累托保留进化搜索。在有限的轨迹预算下,MOAE 维护一个非支配候选方案的经验存档,使用特定于目标的诊断来指导后代生成,并且仅在部署时应用约束感知选择。这将搜索过程中的候选方案保存与用于返回最终解决方案的偏好分离开来。该过程无需参数更新,并允许每个目标被任何可测量属性替代,我们将其具体化为任务性能、轨迹质量和安全性。在 TravelPlanner 和 AgentDojo 上的实验表明,在匹配的轨迹预算下,MOAE 一致地提高了任务性能和轨迹质量,同时保持了强大的安全性。搜索行为分析进一步表明,帕累托保留扩展了可达到的目标区域,并增加了共同改进的频率。这些结果证明了帕累托保留上下文内进化的潜力,能够在搜索过程中无需固定标量化来优化多个代理属性。
查看缓存全文
缓存时间: 2026/09/10 08:45
# MOAE:基于帕累托保持搜索的多目标代理进化
来源:https://arxiv.org/html/2609.05992
###### 摘要
随着基于大语言模型的代理能力持续提升,其评估维度日益多元化:一个能力完善的代理不仅要达到高任务完成率,还需在交互质量、安全性与效率等方面表现出色。这引出了一个核心问题:这些目标能否被同时优化?现有方法虽然考虑了多目标,但许多将异构指标压缩为固定的标量分数。这种标量化依赖于指标归一化与偏好权重,可能丢弃那些代表有效部署权衡的候选方案。我们提出**多目标代理进化(MOAE)**,该方法将基于上下文的迭代改进组织为一种帕累托保持的进化搜索,针对完整的代理轨迹进行优化。在有限轨迹预算下,MOAE维护一个非支配候选的经验存档,使用目标特定的诊断来指导后代生成,并仅在部署阶段采用约束感知的选择机制。这实现了搜索过程中候选保持与部署偏好的解耦。该流程无需参数更新,并允许将任意可量化属性作为优化目标,本文具体实例化为任务性能、轨迹质量与安全性。在TravelPlanner和AgentDojo上的实验表明,在相同轨迹预算下,MOAE能持续提升任务性能和轨迹质量,同时保持强安全性。搜索行为分析进一步显示,帕累托保持扩展了可达目标区域,并增加了联合改进的频率。这些结果证明了帕累托保持的上下文进化在优化多个代理属性方面的潜力,且无需在搜索阶段确定固定的标量化方案。
**广东省脑启发智能计算重点实验室**
**南方科技大学计算机科学与工程系**
{jianghl2025, caiqj2026, luozy2025}@mail.sustech.edu.cn
[email protected]
## 引言
基于大语言模型的代理已从文本生成器迅速演进为能够规划、调用工具、处理环境观测并在多步骤中修正决策的交互系统(Yao 等, 2022; Xie 等, 2024)。随着其能力扩展,仅凭最终答案准确率已不足以评估代理。一个有用的代理应在完成请求任务的同时,产生有效且可靠的交互轨迹,抵御不安全指令,并控制其运行成本。近期基准测试相应地评估了规划约束、工具使用行为、轨迹质量、效率与鲁棒性(Liu 等, 2024; Ma 等, 2024; Jiang 与 Tang, 2026; Zhan 等, 2024; Debenedetti 等, 2024)。这些维度相互关联但未必对齐:增加工具调用可能提升证据覆盖度,却可能引入冗余或无效操作;保守行为可能降低安全风险,却阻碍了有益探索。这促使一个核心问题:能否联合提升LLM代理的多个属性,而非孤立优化?现有方法针对该问题的不同方面进行了探索:迭代改进与语言反馈可修正单个响应或轨迹(Madaan 等, 2023; Shinn 等, 2023),而提示与程序优化器则在开发集上搜索可复用的指令(Yang 等, 2024; Guo 等, 2024; Fernando 等, 2024; Opsahl-Ong 等, 2024; Agrawal 等, 2026)。对齐与代理优化方法也考虑了多偏好、能力与安全或性能与成本(Zhou 等, 2024; Zhong 等, 2024; Yuan 等, 2025; Rosser 与 Foerster, 2026)。这些研究证实代理优化无需局限于单一目标。然而,它们的权衡通常通过固定标量化、预定义约束、学习的偏好参数或跨开发集优化的持久化制品来编码。较少关注有限预算、单次查询优化中,在搜索阶段保持多个轨迹级权衡并在最终选择部署响应时才应用偏好。该场景带来三个实际挑战:第一,代理目标通常不可微,量纲不同,且仅在完整交互后可观测;第二,改进可能存在冲突,保留单一优胜者可能丢弃有用的权衡。固定标量化还需预定义归一化与偏好权重;不当选择可能导致非理想折中,或排除在其他部署需求下有价值的候选。第三,独立采样虽能提供多样性,但未利用已观测的失败来引导后续轨迹。因此,一个有效的在线优化器应保持具有不同优势的候选,针对特定弱点进行改进,并将最终偏好推迟到部署阶段。我们提出**多目标代理进化(MOAE)**,这是一个用于有限预算、单次查询代理优化的帕累托保持框架。MOAE保持模型、工具和代理架构固定,仅进化一个紧凑的执行策略。从基础轨迹开始,它评估完整轨迹,维护局部非支配候选的经验存档,选择目标特定的父代,并利用评估器诊断来指导上下文内变异。候选保持与约束感知部署相分离,允许在搜索后应用最终偏好。我们实例化MOAE时使用任务性能、轨迹质量和安全风险。在TravelPlanner和AgentDojo上的实验显示,与未优化代理相比,MOAE在匹配轨迹预算下取得了提升,并具有竞争力的平衡方案。本工作有三项贡献:第一,将有限预算、单次查询代理优化形式化为多目标问题,分离轨迹目标、候选保持、部署偏好和搜索成本;第二,提出结合经验帕累托保持、目标特定父代选择、诊断指导变异和约束感知部署的进化流程,无需模型或架构更新;第三,在TravelPlanner和AgentDojo上对三种语言模型及多个搜索与代理优化基线进行匹配预算评估。实验既检验了最终性能,也分析了搜索行为,同时通过消融研究隔离了变异、诊断和非支配存档的影响。
## 相关工作
### LLM代理评估
LLM代理结合了语言模型、规划、记忆与外部工具,使最终答案准确率不足以表征其行为。AgentBench和AgentBoard评估跨多样环境的任务完成与交互进展(Liu 等, 2024; Ma 等, 2024),而TravelPlanner在交通、时间、预算与常识约束下衡量长期规划(Xie 等, 2024)。ToolLLM评估API选择与函数调用,而InjecAgent和AgentDojo检验代理在工具观测含间接提示注入时是否保持任务效用(Qin 等, 2023; Zhan 等, 2024; Debenedetti 等, 2024)。这些基准测试确立了任务性能、轨迹有效性、运行效率与安全性为代理质量的独立方面。然而,它们主要提供评估协议,未指明如何联合改进多个被测属性。
### LLM及代理中的成对目标优化
大多数考虑任务准确率以外的现有方法聚焦于预定义的目标对。Safe RLHF和Bi-Factorial Preference Optimization通过约束强化学习或偏好优化平衡有用性与无害性(Dai 等, 2023; Zhang 等, 2024),而MODPO和Panacea学习对齐偏好间的参数化权衡(Zhou 等, 2024; Zhong 等, 2024)。另一条研究路线通过推理压缩、路由或延迟感知的测试时缩放研究准确率与推理效率(Xia 等, 2025; Yan 等, 2025; Wang 等, 2025)。对于集成工具的代理,ParetoPO通过多目标策略训练优化任务准确率与工具使用效率(Li 等, 2026)。这些方法表明语言模型和代理此前已被用于多目标优化。然而,其操作点通常通过预定义约束、学习的偏好参数、固定标量化或特定目标的优化结构来确定。MOAE研究一种互补的设置:异构目标在完整代理轨迹后观测,经验非支配候选在有限单次查询预算下保持,最终偏好在部署时应用而非用于将搜索压缩为单一分数。
### LLM代理进化
进化方法搜索离散语言组件,无需可微目标。EvoPrompt和PromptBreeder进化任务与变异提示,而MIPRO在语言模型程序的指令与示例上搜索(Guo 等, 2024; Fernando 等, 2024; Opsahl-Ong 等, 2024)。GEPA使用执行轨迹与自然语言反思优化可复用文本组件,通过基于帕累托的选择保持跨开发样例的改进(Agrawal 等, 2026)。进化也扩展到代理系统:EvoAgent和AgentBreeder搜索可复用的多代理架构或脚手架,其中AgentBreeder同时考虑能力与安全(Yuan 等, 2025; Rosser 与 Foerster, 2026)。MOCHA在正确性与平台约束下优化持久化结构化技能,而SkillMOO根据任务性能与推理成本进化软件工程技能包(Tanjim 等, 2026; Gong 等, 2026)。这些方法主要优化跨开发任务的可复用制品。相比之下,MOAE针对固定代理进行有限预算、单次查询优化,保持轨迹级目标间的权衡,并将候选搜索与部署选择分离。附录提供了结构化比较。
**图1**:MOAE概览。(a) 帕累托保持的动机。(b) 轨迹初始化。(c) 多目标评估。(d) 说明性进化轨迹。(e) 诊断指导变异与存档更新。(f) 约束感知部署。
## 方法
我们提出**多目标代理进化(MOAE)**,这是一个帕累托保持框架,将单次查询改进组织为结构化的多目标搜索。图1展示了其完整工作流程。MOAE将LLM代理的优化视为对其执行策略的小规模进化搜索。从默认策略开始,代理执行有限次数的完整轨迹,每次轨迹根据多个目标评估。MOAE不为每个候选分配固定的聚合分数,而是保持具有不同优势的经验非支配候选,并使用目标特定的诊断生成紧凑的后代策略。在轨迹预算耗尽后,约束感知选择规则应用部署偏好并返回一个候选。该流程通过模型推理和上下文反馈运行,无需更新代理或变异模型的参数。
### 问题形式化
令 \( x \in \mathcal{X} \) 表示输入查询,\( \mathcal{A}_{\theta} \) 为参数冻结的LLM代理。代理行为由执行策略 \( z \in \mathcal{Z} \) 控制,该策略指定代理如何规划、调用工具、验证中间结果及终止执行。考虑执行随机性 \( \xi \),代理产生完整轨迹 \( \tau = \mathcal{A}_{\theta}(x; z, \xi) \)。候选定义为 \( c = (z, \tau, \mathbf{f}(c), \mathbf{e}(c)) \),其中 \( \mathbf{f}(c) = [f_1(c), \ldots, f_m(c)] \) 和 \( \mathbf{e}(c) \) 分别为基于轨迹 \( \tau \) 计算的目标值与评估器诊断。诊断可能包括约束违反、无支持决策、无效操作、重复工具调用或其他目标相关信号。不同目标可能有不同优化方向,我们为每个目标关联 \( s_j \in \{+1, -1\} \),其中 \( s_j = +1 \) 表示最大化,\( s_j = -1 \) 表示最小化,并定义方向对齐目标 \( u_j(c) = s_j f_j(c) \)。所有对齐目标因此被最大化。若满足 \( \left[ \forall j, u_j(c_a) \geq u_j(c_b) \right] \land \left[ \exists j, u_j(c_a) > u_j(c_b) \right] \),则候选 \( c_a \) 帕累托支配候选 \( c_b \),记为 \( c_a \succ c_b \)。对于候选集 \( \mathcal{S} \),其经验非支配子集为 \( \operatorname{ND}(\mathcal{S}) = \left\{ c \in \mathcal{S} : \nexists c' \in \mathcal{S} \ \text{s.t.} \ c' \succ c \right\} \)。我们的目标是在有限在线轨迹预算下改进代理,同时保持代表不同目标权衡的候选。该框架仅要求每个目标可从轨迹计算。相似文章
基于LLM的多目标贝叶斯优化算法演化生成
本文扩展了LLaMEA框架,利用大型语言模型作为进化策略中的变异和交叉算子,自动设计多目标贝叶斯优化算法,在合成和实际问题中以显著更低的计算成本实现了最先进的精度。
MetaEvo: 一种用于经验驱动型智能体持续进化的元优化框架
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
MOCHA: 基于切比雪夫退火的多目标智能体技能优化
MOCHA 提出了一种面向 LLM 智能体技能的多目标优化方法,通过切比雪夫标量化和指数退火策略来应对严格的平台约束,发现帕累托最优变体,相较于现有优化器取得了显著改进。
HMACE:面向组合优化的异构多智能体协同进化
本文介绍了 HMACE,这是一种异构多智能体协同进化框架,利用大型语言模型(LLM)自动化设计启发式算法,以解决 NP 难组合优化问题。实验表明,在旅行商问题(TSP)和装箱问题(BPP)等任务上,该方法在质量与效率的权衡方面优于单智能体和基准多智能体方法。
AgentPSO:通过多智能体粒子群优化进化智能体推理技能
AgentPSO 是一种受粒子群算法启发的框架,通过将智能体视为以自然语言技能为状态的粒子,来进化多智能体推理能力。它在无需更新基础语言模型参数的情况下,提升了在推理基准测试上的性能。