Harness优化价值何在?自演化LLM代理中的局部增益与预算分配陷阱
摘要
本文介绍HarnessEvo,将LLM代理框架分解为可独立演化的槽位,揭示优化价值局部存在于反思/控制等特定组件中,均匀预算分配次优,并主张针对性的预算集中。
arXiv:2609.02889v1 公告类型:新
摘要:越来越多的工作通过演化框架来改进冻结的大语言模型(LLMs)作为代理:围绕模型的文本脚手架,包括角色、策略、格式规则和控制启发式。现有的反思提示演化方法通常将此框架作为单一扁平字符串进行优化。我们则探究优化价值实际所在之处。我们引入HARNESSEVO,将框架分解为四个可独立演化的槽位:角色、任务策略、工具/格式规则和反思/控制。在等预算设置下使用相同的反思优化器,我们通过留一入和留一出归因来衡量每个槽位的贡献。
在ALFWorld上使用冻结的7B骨干模型,HARNESSEVO并未显著提高整体二元成功率:与库存框架或扁平字符串演化相比分别为0.657 vs 0.642和0.642。然而,槽位级分析显示,几乎所有有用的优化价值都局部存在于反思/控制槽位,其留一入增益为+0.119。其他槽位单独无效。我们进一步表明均匀预算分配有害:将64次展开分配给四个槽位,每个槽位仅16次,低于优化器的有效搜索下限,导致每个槽位冻结在空种子状态。将预算集中于高信用控制槽位可恢复损失增益,以一半的分配预算达到0.761。
效果具有任务依赖性。在WebShop上,所有槽位均冻结为空,所有方法持平,表明真正缺乏可循环、可表述的控制失败,而非预算不足。总体而言,我们的结果表明框架价值是局部的,均匀预算分配可能有害,且信用分配应在结构化代理演化之前进行。
查看缓存全文
缓存时间: 2026/09/04 05:50
# 马具优化价值何在?自进化LLM智能体中的局部增益与预算分配陷阱 来源:https://arxiv.org/html/2609.02889 Wei Chen Tan1 Nurul Aisyah Hassan2 Arvind Raman3 Li Hua Lim1 Ahmad Faiz Razak2 Jia Hui Wong3 1马来亚大学 2理科大学 3博特拉大学 4莫纳什大学马来西亚分校 马来西亚吉隆坡 / 槟城 / 蒲种 ###### 摘要 越来越多的研究通过*演化马具*——包裹在模型周围的文本脚手架(角色、策略、格式规则、控制启发式)——使冻结的大型语言模型(LLM)成为更优的智能体。主流方案以反思式提示演化为代表,将马具视为单一扁平字符串并整体优化。我们提出更精准的问题:*马具内部,优化价值实际存在于何处?* 我们引入HarnessEvo,将马具分解为四个独立演化的命名槽位(角色、任务策略、工具/格式规则、反思/控制),并在等预算约束下采用留一包含/留一排除(loi/loo)协议依次调优各槽位,将留出增益归因于单个槽位。 此结构化分解并非用于排行,而是作为*显微镜*。在冻结7B骨干网络的ALFWorld测试中,完整方法在二元成功指标上与基线*持平*:HarnessEvo达到0.657,与现有方案的0.642及扁平字符串演化的0.642相当(McNemar检验p=0.617与p=0.480,均不显著)。 显微镜揭示的结果更具意义: (i)*局部性*:全部增益集中于单一槽位——反思/控制槽,其留一包含增益为+0.119(p=0.0046,22个不一致任务中6个翻转);而角色、策略、格式槽单独变化均不显著。 (ii)*预算分配陷阱*:结构化方法呈现强次可加性(总增益+0.015 ≪ 各槽位留一包含增益之和+0.164),因反思优化器存在接受-重评*阈值*;将64次部署的等预算分配给四个槽位后,每槽仅16次,低于该阈值,导致所有槽位冻结于空初始状态,承载增益的槽位从未被激活。 (iii)*预算分配方案*:将相同预算集中于高贡献槽位可回收损失的增益——针对单槽位的运行以*半额*预算达到0.761(+0.119,p=0.0046);全预算全控制运行达到0.724(+0.082,p=0.0725,边缘显著;我们如实报告两者,不过度宣称大预算结果)。 (四)*任务依存性*:该现象具有基准特异性;WebShop上所有槽位均冻结为空,各方法持平(0.518/0.539/0.545,不显著),针对性控制运行在该数据集上亦无效果——证实WebShop结果源于真实缺乏可重复表述的控制故障,而非预算不足。 实际存活的马具优化价值体现为*基于环境的自主修正*(如“跳过返回‘无变化’的重复动作、取物前打开闭合容器、放置前确认持有物体、目标满足时停止”),而非奖励利用策略。 我们得出结论:马具价值具有局部性,均匀预算分配有害,信用分配与预算集中应先于任何结构化智能体演化方案。 关键词:大型语言模型智能体、自演化智能体、提示优化、智能体脚手架、信用分配、留一包含消融、预算分配、次可加性、ALFWorld、WebShop 图注:图1:马具优化价值集中于单一组件。各槽位留一包含增益(ALFWorld留出集n=134,冻结7B骨干网络):仅演化*反思/控制槽*(c₄)增益+0.119(p=0.0046),而角色(c₁)、策略(c₂)、格式(c₃)槽单独演化与现有马具无显著差异。在*相同*预算四路分割下演化所有槽位(Δ=+0.015,不显著)及扁平字符串演化(Δ=+0.000,不显著)均与基线持平:均匀分配*剥夺*了承载增益槽位的资源。误差棒为配对留出差值的95%自助法区间。 ## 1 引言 冻结的大型语言模型无需调整任何权重,仅通过优化其周围文本即可转变为显著更强的智能体。智能体的*马具*——在每一步注入模型周围的系统提示、角色描述、任务策略、动作模板与循环控制指令——一阶决定了现成LLM在交互环境中的行为。 快速增长的相关文献利用了这一事实:相比微调,该方法*优化马具*,将提示文本视为参数,通过反思反馈、演化变异或记忆累积进行搜索。该家族的旗舰方法——反思式提示演化——报告称,演化单一指令字符串能以极低的部署成本匹配或超越强化学习。 这些方法的吸引力恰在于其低成本、无需权重修改且仅需模型黑盒访问。然而几乎所有此类工作都将马具视为*无差别的整体*:单一扁平字符串被整体变异、评分和选择。 这混淆了扮演不同角色的组件:角色行(“你是细心的家居助手”)、任务分解策略(“首先在容器通常所在位置寻找物品”)、动作格式规则(“使用模板'从...取出'每行输出一个动作”)、控制启发式(“永不重复返回‘无变化’的动作;目标满足时停止”)均被纳入同一字符串联合优化。 当该方法有效时,我们得知*马具可被改进*;却未明确*马具的哪部分重要*,因此无法判断下次优化应将预算投入角色、策略、格式还是控制逻辑。该领域有排行榜却无地图。 本文直指地图绘制问题:*马具内部,优化价值存在于何处?* 我们通过刻意设计的结构化工具予以回答:将马具分解为四个互斥、可独立演化的命名槽位——c₁角色/人格、c₂任务策略、c₃工具/格式规则、c₄反思/控制启发式——采用坐标上升法逐槽演化,复用现有反思提示优化器,在总部署预算严格等于扁平字符串演化的约束下逐槽调优。 我们结合留一包含/留一排除信用分配协议:loi单独演化单个槽位并测量其相对现有马具的边际价值;loo演化除单槽位外的所有槽位,测量完整马具缺失该槽位的损失。 *我们首先强调:结构化分解是显微镜而非产品*。我们不声称分解马具能产生更优智能体——在二元指标上它并未实现。我们声称它能揭示扁平方法不可见的洞见。 其揭示的是显著且关键的非对称性:在冻结7B骨干网络的ALFWorld上,完整结构化方法与两基线持平——留出集成功率达0.657,现有马具为0.642,扁平字符串反思演化为0.642,差异均不显著(相对现有方案p=0.617,相对扁平方案p=0.480)。 仅看到该数字的读者可能合理推断结构化马具演化无效。但loi图谱显示增益并未消失——而是*局部集中*。 仅演化反思/控制槽c₄使留出成功率提升+0.119(p=0.0046;两马具不一致的28个任务中22个向演化后控制方案翻转),而仅演化角色、策略或格式槽均不显著(+0.030、+0.007、+0.007;均不显著)。 马具优化的价值——至少在该基准测试上——几乎完全存在于四个组件之一。 为何完整方法持平?因结构化方法呈现强*次可加性*,我们已识别其机制:完整马具相对现有方案的增益仅+0.015,而四个loi增益之和达+0.164——相差一个数量级。 根源在于坐标上升预算分割与反思优化器结构特性的交互:其存在接受-重评*阈值*。每次优化迭代使用部署评分父代与变异子代的小批量,仅当子代被接受时才在完整验证集上进行重评。将64次部署的等预算四等分后,每槽仅16次——低于接受并冻结任一变异的阈值,因此结构化方法将*所有槽位*冻结于空初始状态,产生与现有方案字节一致的马具,从未捕获c₄的增益。 朴素结构化演化在此*弊大于利*:因分解将预算稀释至优化器工作点以下,其效果劣于针对性单槽运行。我们称之为*预算分配陷阱*。 该陷阱直接隐含其解:在固定预算下,不应均匀分割,而应*集中*投入高贡献槽位。我们通过两种方式验证并如实报告:以*半额*分割预算(32次部署,全投c₄)运行控制槽留一包含实验,成功率达0.761,相对现有方案增益+0.119显著(p=0.0046)。全预算(64次部署)全控制运行成功率达0.724,增益+0.082为正且显著高于四路分割的0.657,但McNemar检验呈边缘显著(21 vs 10不一致,p=0.0725,不显著)。 *方向*稳健——两种针对性运行均优于分割方案且优势明显——但考虑到演化与解码随机性,n=134时精确幅度存在噪声,故我们保守声称:针对性单槽演化可回收均匀预算分配丢弃的+0.08至+0.12增益,*不*宣称大预算结果显著。 最后,该现象具有*任务依存性*。在相同骨干网络与协议的WebShop上,所有槽位冻结为空,完整方法与两基线持平(0.518/0.539/0.545稠密评分,均不显著);关键的是,针对性全控制运行*同样无效*,控制槽再次冻结为空。 这排除了WebShop上预算不足的解释:优化器获得集中预算后仍未发现可接受内容。差异体现在审核后的槽位文本中:ALFWorld上有效的控制规则编码了可重复表述的控制故障(重复死胡同动作、闭合容器、过早停止),这些故障在家居任务中反复出现;WebShop的购物任务具有稠密属性匹配奖励,根本不存在可通用启发式修复的控制失败模式。 马具优化捕获的价值——在它能捕获时——体现为*基于环境的自主修正*,而非奖励利用策略。我们将此作为对抗智能体针对可游戏环境奖励优化之担忧的建设性反论点展开。 #### 贡献。我们做出四项贡献,每项均为诚实特征描述而非排行榜宣称。 1. 1\. **组件分解马具与留一包含信用分配协议**:定位*马具优化价值的所在*。ALFWorld上价值主要集中于反思/控制槽(loi增益+0.119,McNemar p=0.0046,22 vs 6);角色、策略、格式槽单独变化均不显著。我们不宣称二元胜利——完整马具与现有方案及扁平字符串演化持平(0.657/0.642/0.642,不显著)。 2. 2\. **带机制的次可加性结果**:总增益(+0.015)远低于四个单槽增益之和(+0.164)。根源在于坐标上升反思演化中的接受-重评阈值:64次部署等预算四等分后每槽仅16次,低于阈值,故结构化方法冻结所有槽位为空,从未捕获承载增益。均匀结构化演化劣于针对性运行,因分解将预算稀释至优化器工作点以下。 3. 3\. **预算分配方案**:固定预算下,集中投入高贡献槽位可回收均匀分割丢弃的增益:全控制运行以*半额*分割预算实现+0.119增益(p=0.0046),全预算运行确认方向(0.724,+0.082,边缘显著)。我们并列报告显著(@32)与边缘(@64)结果,不过度宣称大预算。 4. 4\. **任务依存性边界**:局部性具有基准特异性。WebShop上方法全无效——所有槽位冻结为空(0.518/0.539/0.545,不显著),针对性控制运行在该数据集亦无效,证实WebShop结果源于真实缺乏可重复表述的控制故障,而非预算不足。我们通过审核控制规则文本刻画*马具优化在何种任务有效*(具有可重复表述控制故障的任务:死胡同动作、顺序约束、过早停止)。 图1预览核心发现。第2节定位研究;第3节形式化马具优化问题与组件分解;第4节阐述HarnessEvo架构、坐标上升算法与loi/loo协议;第5节详述实验设置;第6节报告主要结果;第7节分析信用分配与预算分配陷阱;第8、9节讨论影响与局限。 ## 2 相关工作 ### 2.1 提示与智能体自演化 冻结模型可通过优化周围文本改进的前提,支撑了庞大且快速发展的文献。早期自动提示搜索将指令视为待提议与选择的离散对象:APE使用模型本身生成并排序指令。
相似文章
工具更新并非工具收益:自进化LLM智能体中进化能力的解耦
本文分析了自进化LLM智能体中的两种能力:工具更新能力和工具收益能力。研究发现工具更新能力在不同基础能力层级间持平,而工具收益能力则呈现非单调性,其中中等层级模型收益最大。
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
HarnessDev:LLMs能否创建并演化其自身的代理执行框架?
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。
EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。