MAGE:理解多组件提示优化中的稳定性与性能权衡
摘要
本文介绍了MAGE,一个用于分析提示优化中组件交互的框架,揭示了一种提示优化耦合效应(POCE),其中结合多个随机信号可以提高性能但会增加方差。它提供了对稳定性-性能权衡的洞察以及提示优化的实用指导。
arXiv:2607.11944v1 公告类型:新
摘要:迭代提示优化的不同组件如何相互作用,当它们组合时会发生什么?我们通过MAGE(记忆增强的目标导向提示演化)来研究这个问题,这是一个用于分析提示优化中组件交互的受控框架。MAGE并非在绝对意义上被提出为一种更优的优化器;它集成了情景记忆、多目标帕累托选择和自适应评估,作为一个用于受控消融实验的平台。我们的实验揭示了一个先前未被报道的现象,即提示优化耦合效应(POCE):当多个随机优化信号在一个封闭的反射循环中运行时,它们以一种同时提高性能和放大方差的方式相互作用,这种行为无法通过单独分析组件来预测。主要发现有三点。首先,基于失败的反思至关重要:仅依赖评分(OPRO)或抽象批判(Self-Refine)的方法无法改进提示。其次,MAGE在GSM8K-Hard上达到46.4%,而GEPA为34.0%(提升+12.4%,P(MAGE>GEPA)=0.998,5个种子,基于gpt-4o-mini),方差相当(7.3%对比7.0%)。第三,增加候选项多样性揭示了最清晰的POCE信号:将候选池从n=3扩展到n=5使平均准确率提升+21.6%,同时方差增加3.7倍。我们进一步在Llama 3.1 8B上验证,并显示POCE具有天花板依赖性:当基础模型已经达到高准确率时,方差放大消失。最后,在低数据场景(Ntrain=30)中,精心设计的固定提示优于所有反射式优化器,这表明脚手架选择主导了优化器选择。我们的结果表明,提示优化系统表现为耦合的随机过程,应同时评估其性能和稳定性,而不仅仅是峰值准确率。
查看缓存全文
缓存时间: 2026/07/15 04:21
# 理解多组件提示优化中的稳定性与性能权衡 来源:https://arxiv.org/html/2607.11944 ###### 摘要 迭代提示优化的不同组件如何相互作用——当它们被组合时会发生什么? 我们通过Mage(记忆增强目标导向提示演化)来研究这个问题,这是一个用于研究提示优化中组件交互的受控分析框架。Mage并非被提出作为绝对意义上更优的优化器;它集成了三种机制——情景记忆、多目标帕累托选择和自适应评估——作为受控消融的平台。我们的实验揭示了一个先前未报道的现象,即提示优化耦合效应(POCE):当多个随机优化信号在封闭的反思循环中运作时,它们以同时提升性能和放大方差的方式相互作用——这种行为无法通过单独分析组件来预测。 三个主要发现浮现出来。首先,基于失败的反思是必不可少的:仅依赖分数(OPRO)或抽象批评(Self-Refine)的方法无法改进提示,要么停留在种子提示,要么降低性能。其次,Mage在GSM8K-Hard上达到46.4%(对比Gepa的34.0%,+12.4%,P(Mage>Gepa)=0.998,5次种子,gpt-4o-mini),方差相当(±7.3% vs. ±7.0%)。第三,增加候选多样性揭示了最清晰的POCE信号:将候选池从n=3扩大到n=5,平均准确率提升+21.6%,同时方差增加3.7倍。 我们进一步在Llama 3.1 8B上验证,发现POCE依赖于性能提升空间:当基础模型已经达到高准确率时,方差放大消失。在使用1.5B模型进行的设备端部署验证中,Mage在5次种子中平均2.0±0.0次迭代收敛(100%收敛率),工具选择准确率达到0.95±0.03——包括完全解决对抗性设计的提示。 最后,在低数据场景(N_train=30)下,设计良好的固定提示优于所有反思型优化器,表明模板选择主导优化器选择——这是一个我们强调而非弱化的实用发现。我们的结果表明,提示优化系统表现为耦合随机过程,应同时根据性能和稳定性来评估,而不仅仅是峰值准确率。 Mage:理解多组件提示优化中的稳定性与性能权衡 Prateek Singh [email protected] ## 1 引言 提示已成为部署大型语言模型的主要接口(Brown 等人,2020 (https://arxiv.org/html/2607.11944#bib.bib1);Wei 等人,2022 (https://arxiv.org/html/2607.11944#bib.bib3))。然而,设计有效的提示在很大程度上仍然是手动过程,这推动了自动提示优化方面越来越多的研究(Zhou 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib5);Pryzant 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib6);Yang 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib7);Yuksekgonul 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib8))。 在近期的方法中,Gepa(Agrawal 等人,2025 (https://arxiv.org/html/2607.11944#bib.bib2))表明,反思式提示演化——其中LLM使用具体失败案例批评和优化自身提示——可以与强化学习方法相媲美,同时需要的评估次数少得多。这使自然语言反思成为强大且实用的优化机制。 #### 我们的关注点。 我们并没有提出最大化基准分数的优化方法,而是关注一个更基础的问题:不同优化组件在组合到单一系统中时如何相互作用?我们将Mage定位为一个受控分析框架,而非声称优于所有基线——这种定位是明确做出的,因为我们的实验表明,在GSM8K-Hard上,当N_train=30时,强大的固定模板优于所有反思型优化器。现实世界的流程将记忆、选择和评估结合在迭代循环中;然而,这种组合系统的行为仍知之甚少。 为了研究这一点,我们引入了提示优化耦合效应(POCE):观察到组合多个随机优化信号会产生非加性行为,性能和方差以无法从单个组件预测的方式出现。我们表明这对可靠性和部署有直接影响。 一个关键的实际见解也浮现出来:在低数据设置下,优化后的提示可能不如强大的固定提示,这表明模板设计往往比优化本身更重要。 #### 四个实证问题。 反思是否必要?仅基于分数的方法如OPRO(Yang 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib7))无法在初始种子提示上改进——在所有运行中返回相同的提示。基于失败是否必要?Self-Refine(Madaan 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib22))最初降低性能(33.3%→16.7%),然后恢复。没有具体的失败信号,模型会覆盖有用的策略而不是修复错误。模板是否比优化器更重要?MIPROv2+CoT(Opsahl-Ong 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib35))主要通过其思维链模板实现了强性能(71.1%);在其上应用MIPROv2优化器导致-2.2%的倒退。POCE是否跨模型和设置泛化?在Llama 3.1 8B上,种子准确率已经约70%,两个优化器收敛相同——POCE是有条件的,依赖于性能提升空间。在设备端1.5B部署中,Mage在5次种子中平均2.0±0.0次迭代收敛(100%收敛率)。 #### 为什么这很重要。 大多数先前工作报告单次种子的峰值性能,隐含地将优化视为确定性过程。Mage表明多组件优化器是耦合随机系统:均值和方差由组件交互共同决定。仅报告均值掩盖了从业者必须应对的稳定性代价。我们主张方差应与均值一起作为首要评估指标,并基于我们的发现提供了场景特定的部署指南(表3 (https://arxiv.org/html/2607.11944#S6.T3))。 #### 贡献。 1. 基于失败的反思是必要的。OPRO和Self-Refine都失败;Self-Refine的无根据批评通过一种与OPRO停滞机制不同的方式主动降低准确率。 2. 提示优化耦合效应(POCE)。组件交互带来的非加性方差放大。Mage比Gepa高出+12.4%(P(Mage>Gepa)=0.998,5次种子),方差无法从单个组件预测。注意:Mage并不声称优于强大的固定模板;它研究耦合随机优化的动态,表明仅报告此类系统的均值会系统性地误导人。 3. 帕累托多样性阈值。n=3→5时均值提升+21.6%,同时方差增加3.7倍——这是最清晰的因果POCE证据。 4. 模板主导优化器。MIPROv2+CoT的增益完全来自CoT模板;优化器贡献为-2.2%。 5. 设备端部署验证。Mage应用于1.5B设备端模型,在2.0±0.0次迭代中达到0.95±0.03的工具选择准确率(5次种子,100%收敛),包括完全解决对抗性提示。 6. 部署指南。场景特定指南(表3 (https://arxiv.org/html/2607.11944#S6.T3))将POCE权衡映射到从业者决策,基于我们在稳定性和均值准确率维度上的消融结果。 ## 2 相关工作 #### 提示优化。 APE (Zhou 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib5)), APO (Pryzant 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib6)), OPRO (Yang 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib7)), 和 TextGrad (Yuksekgonul 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib8)) 建立了该领域。DSPy (Khattab 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib9)) 编译LLM流水线;MIPROv2 (Opsahl-Ong 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib35)) 是其贝叶斯优化器。Gepa (Agrawal 等人,2025 (https://arxiv.org/html/2607.11944#bib.bib2)) 引入了基于失败的反思式演化。Mage使用Gepa作为受控骨干来研究组件交互动态——这是先前工作未研究的问题。 #### 多目标优化。 NSGA-II (Deb 等人,2002 (https://arxiv.org/html/2607.11944#bib.bib11)) 是经典的帕累托算法。据我们所知,Mage是首个在迭代提示优化中应用基于用户定义质量目标的帕累托前沿推理的工作。 #### 记忆增强LLM。 MemGPT (Packer 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib16)) 和 RAG (Lewis 等人,2020 (https://arxiv.org/html/2607.11944#bib.bib17)) 促进了情景记忆。Mage将跨任务检索具体应用于提示优化循环,使用Jaccard重叠作为轻量级代理;密集检索可以减少跨任务干扰(附录B (https://arxiv.org/html/2607.11944#A2))。 #### LLM作为评判者。 MT-Bench (Zheng 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib20)) 和 AlpacaEval (Dubois 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib21)) 研究了评估者可靠性。据我们所知,Mage的集成锚定自适应评估器是提示优化中首个专门为长周期稳定性设计的共同演化评判者。 #### 设备端LLM部署。 关于模型压缩的最新工作 (Frantar 等人,2022 (https://arxiv.org/html/2607.11944#bib.bib38); Lin 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib39)) 使得小模型部署成为可能。与权重级优化不同,Mage仅优化提示,因此可直接应用于权重在部署后无法修改的锁定推理运行环境,例如Google LiteRT和Apple CoreML。 ## 3 问题陈述 对于具有数据集D={(x_i, y*_i)}的任务,提示优化寻求: π* = arg max_π (1/N) Σ_{i=1}^N 1[hat{y}_i = y*_i]. (1) Gepa (Agrawal 等人,2025 (https://arxiv.org/html/2607.11944#bib.bib2)) 通过反思式变异和实例级帕累托选择来解决式(1)。Mage将其扩展到多目标帕累托优化质量目标(准确率、简洁性、安全性),同时添加记忆和自适应评判者。我们的研究仅改变这三个添加项,保持其他所有条件不变,以隔离交互效应。 ## 4 Mage:框架设计 Mage在Gepa循环中添加了三个组件。 ### 4.1 情景记忆 我们维护 M = {(e_k, π_k, τ_k, s_k)}_{k=1}^K 其中 e_k ∈ R^d 是任务嵌入,π_k 是找到的最佳提示,τ_k 是反思轨迹,s_k ∈ R^m 是分数向量。对于新的任务嵌入 e,我们按余弦相似度检索前 κ 个条目,并将它们作为上下文示例提供给提议者。运行结束时,最佳(提示、轨迹、分数)元组被写回。 ### 4.2 多目标帕累托选择 我们将标量目标替换为三个:f_1(π) = 准确率,f_2(π) = -|π|_tok(负的token数,即简洁性),f_3(π) = 安全分数。提示 π 帕累托支配 π' 如果它在所有目标上至少一样好,并且在至少一个目标上严格更好。我们在每次迭代时维护非支配前沿。候选池大小 n 对帕累托有效性至关重要:当 n=3 时,候选中的准确率方差太小,无法产生有意义的帕累托压力;当 n=5 时,前沿变得信息丰富。这个阈值效应是本文的核心受控实验。 ### 4.3 集成锚定自适应评估器 固定评估器 E^{fix} 在 T 次迭代中累积偏差 O(T ε_E)。我们通过以下方式自适应校准: E_t = α_t E^{fix} + (1 - α_t) E_t^{adp}, α_t = α_0 γ^t. (2) 这旨在限制评估器在迭代过程中的漂移;在理想化假设下的形式化界在附录A (https://arxiv.org/html/2607.11944#A1)中给出,不过现实中的LLM评估器可能不满足所有假设。指数衰减的锚点 α_t 减少了——但并未消除——评估器与 E^{fix} 的偏差。 ### 4.4 算法 算法1 Mage:记忆增强目标导向提示演化 1: 任务 T, 数据集 D, 记忆 M, 种子提示 π_0, 提议者 P, 评估器 E^{fix}, 反思器 R, 迭代次数 T, 候选数 n, 检索数 κ, 初始锚点 α_0, 衰减率 γ 2: 输出:帕累托最优集 P*, 更新后的 M 3: C ← TopK_κ(M, Enc(T)); P* ← ∅; E_0^{adp} ← E^{fix} 4: for t = 1 ... T do 5: Π_t ← P(π_{t-1}, C, D, n) ▷ 使用记忆上下文提议 n 个候选 6: 通过 E_t (式2) 对每个 π ∈ Π_t 评分 7: E_{t+1}^{adp} ← MetaReflect(E_t^{adp}) 8: P* ← P(P* ∪ Π_t) ▷ 帕累托更新 9: τ_t ← R(P*, s(P*)) ▷ 对前沿进行口头反思 10: end for 11: M ← M ∪ {(Enc(T), P*_best, τ*, s*)} 12: return P*, M ## 5 实验 ### 5.1 设置 #### 基准。 GSM8K-Hard:82个多步算术问题,需要3-4步运算、单位转换和百分比链;使用80个示例(30个训练 + 50个测试),保留2个。BBH-Logic-Hard (Suzgun 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib28)):来自Big-Bench Hard的81个对抗性逻辑推理问题;使用80个示例(30个训练 + 50个测试),保留1个。每个测试问题等于2%准确率。训练/测试分割在所有实验前固定;任务ID包含在发布的代码中。 #### 基线。 OPRO (Yang 等人,2024 (https://arxiv.org/html/2607.11944#bib.bib7)):仅基于分数的提议,无反思。Self-Refine (Madaan 等人,2023 (https://arxiv.org/html/2607.11944#bib.bib22)):抽象自我批评,无失败案例。
相似文章
提示优化为何有效,为何有时无效:基于因果启发的编辑级分析
本文对自动化提示优化进行了基于因果启发的分析,涵盖多种框架、大语言模型和任务,识别出特定编辑类型(如复杂度增加型、元指令型)根据任务特征具有系统的负面或正面效应,从而解释了泛化失败的原因。
BayesPO: 基于并行回火梯度引导离散MCMC的贝叶斯提示优化
本文提出BayesPO,一种使用梯度引导离散MCMC与并行回火的贝叶斯提示优化框架,在指令归纳任务上提升了准确率。
SAGE:基于智能体引导的随机提示优化
介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。
SePO:用于系统提示优化的自进化提示智能体
SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。
自监督提示优化
本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。