FLARE:基于少样本学习的自适应反思引擎

arXiv cs.CL 论文

摘要

FLARE是一个新框架,将少样本学习与反思机制相结合,以优化大语言模型的指令,在包括HotPotQA、工具调用和GoEmotions在内的多个基准测试中均优于GEPA。

arXiv:2608.02919v1 公告类型:新 摘要:大语言模型(LLM)越来越多地部署在复杂的复合AI系统中,其性能取决于提示词的质量。近期最先进的优化器如GEPA(遗传-帕累托)认为,反思性指令进化可以超越传统的强化学习和少样本优化。在这项工作中,我们挑战了这一转变,引入了FLARE(基于少样本学习的自适应反思引擎),这是一个利用高级反思机制和少量少样本参考示例来优化指令的框架。我们在多个基准测试套件上评估了我们的方法——涵盖检索增强推理(HotPotQA、MedQA、2WikiMultiHopQA)、工具调用和多标签情感分类(GoEmotions)——使用GPT-5系列模型。我们的结果表明,FLARE在所有任务-模型组合上均持续优于GEPA:在HotPotQA上最高提升+14.2分(使用GPT-5-Chat时52.2对比GEPA的42.2),在工具调用上达到87.0%(对比GEPA的81.0%),并在包含5408个示例的完整测试集上使用GPT-5.1将GoEmotions的micro-F1提升至52.7%(+15.3),是GEPA的+5.7增益的两倍多。除原始准确率外,FLARE还具有显著的数据效率:在GoEmotions上,它仅使用100个验证示例即可达到峰值性能,同时在随机种子间的稳定性也明显优于GEPA。我们的研究结果表明,尽管反思性指令非常强大,但少样本学习的策略性优化仍然是最大化下一代LLM潜力的关键前沿。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# FLARE:基于少样本学习的自适应反思引擎
来源:https://arxiv.org/html/2608.02919
Dhanasekar Sundararaman, Bharat Gandhi, Aashna Garg, Minjie Li

###### 摘要。

大型语言模型 \(LLMs\) 越来越多地被部署在复杂的复合 AI 系统中,其性能取决于提示词的质量。最近最先进的优化器如 GEPA(Genetic-Pareto)主张,反思性指令进化可以超越传统的强化学习和少样本优化。在这项工作中,我们通过引入 FLARE(Few-shot Learning-based Adaptive Reflective Engine,基于少样本学习的自适应反思引擎)来挑战这一转变。该框架利用先进的反思机制和一小部分少样本参考示例来优化指令。我们使用 GPT-5 系列模型,在涵盖检索增强推理(HotPotQA、MedQA、2WikiMultiHopQA)、工具调用和多标签情感分类(GoEmotions)的多样化基准套件上评估了我们的方法。结果表明,FLARE 在每对任务-模型组合上都持续优于 GEPA:它在 HotPotQA 上取得了高达 +14.2 分的提升(52.2 vs. GEPA 的 42.2,使用 GPT-5-Chat),在工具调用上达到 87.0%(GEPA 为 81.0%),并使用 GPT-5.1 将 GoEmotions 的 micro-F1 提升至 52.7%(+15.3),在完整的 5,408 示例测试集上,这一提升是 GEPA(+5.7)的两倍多。除了原始准确率,FLARE 还具有显著的数据效率:在 GoEmotions 上,它仅使用 100 个验证示例就达到了峰值性能,同时在随机种子上的稳定性明显优于 GEPA。我们的研究结果表明,虽然反思性指令功能强大,但少样本学习的策略性优化仍然是最大化下一代 LLM 潜力的关键前沿。

## 1. 引言

前沿大型语言模型 \(LLMs\) 的出现,将 AI 开发的挑战从模型训练转移到了复杂复合 AI 系统的工程构建上。在这些系统中,性能由提示词的质量决定,提示词必须协调推理、工具操作和特定领域的逻辑。然而,手动优化提示词是不可扩展的,并且常常无法捕捉到实现卓越性能所需的细微差别。自动提示词优化已成为一种解决方案,从简单的离散搜索发展到复杂的反思框架。

一个突出的最新进展是 Genetic-Pareto(GEPA)(Agrawal et al., 2025 (https://arxiv.org/html/2608.02919#bib.bib2)),它利用自然语言反思来进化高级指令。GEPA 断言了该领域的一个重大转变:随着模型变得能力更强,仅靠指令进化就能超越传统的少样本优化。虽然 GEPA 提供了强大的规则发现机制,但我们认为仅靠指令的反思往往缺乏必要的接地(grounding),尤其是在成功与失败之间的差异在于抽象规则无法完全捕捉的细微执行模式的任务中。

在这项工作中,我们引入了 FLARE(Few-shot Learning-based Adaptive Reflective Engine,基于少样本学习的自适应反思引擎),111官方实现:https://github.com/microsoft/FLARE---Few-shot-Learning-based-Adaptive-Reflective-Engine
一个将反思性提示词优化扎根于显式、逐实例失败信号的框架。GEPA 在执行轨迹上反思以进化高级指令,并通过遗传-帕累托选择搜索候选池;而 FLARE 则利用前沿 GPT-5 系列模型的推理能力来诊断*具体的*错误并直接修复它们。

在我们细粒度的错误感知反馈循环中,前沿 GPT-5 系列模型对每个验证示例执行专门的“思考”阶段,同时结合主模型的预测和显式的正确性标签(Match: WRONG)。它不是进化抽象规则,而是自主诊断每个失败的根源,并用有针对性的修正重写提示词,将每个观察到的错误转化为直接、外科手术式的指令更新。这使得模型能够基于对其自身缺点的接地、模型驱动的分析来调整其预测逻辑。

我们在 GPT-5 系列上的实证评估表明,这种迭代、错误聚焦的接地方式在广泛的基准上显著优于 GEPA 的仅指令进化:

- •数据高效的分类:在 GoEmotions 多标签情感分类上使用 GPT-5.1,FLARE 将 micro-F1 提升至 52.7%,比基线提升 +15.3,是 GEPA(+5.7)提升的两倍多——同时仅使用 100 个验证示例就达到了峰值性能。
- •卓越的推理能力:在 HotPotQA 上使用 GPT-5-Chat,FLARE 实现了 52.2 的优化平均值,比基线提升 +14.2,并领先 GEPA(42.2)10 分。
- •复杂工具使用的增益:在工具调用任务中,我们的框架达到了 87.0% 的准确率,而 GEPA 达到的上限为 81.0%。

本文的核心贡献在于证明:当反思植根于对具体失败模式的迭代诊断时,提示词优化最为有效。通过将错误感知反馈与一小部分少样本参考示例相结合,我们表明最近提出的“远离”少样本接地优化的转变还为时过早。取而代之的是,我们提供了一种最先进的方法论,用于最大化当今最强模型的价值。

## 2. 相关工作

自动提示词优化的最新进展已在各种任务中显著提升了 LLM 的性能。DSPy (Khattab et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib10)) 引入了一个声明式框架,将语言模型调用编译为自我改进的流水线,从而能够通过程序化组合对提示词进行系统优化。在此基础上,GEPA (Agrawal et al., 2025 (https://arxiv.org/html/2608.02919#bib.bib2)) 证明了反思性提示词进化可以通过根据性能反馈迭代优化提示词,超越传统的强化学习方法。Yang 等人 (Yang et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib19)) 提出了 OPRO,它将提示词优化构建为一个优化问题,其中 LLM 本身充当优化器,使用元提示在 GSM8K 等基准上生成并细化任务特定指令。在 DSPy 生态系统中,BootstrapFewShot 优化器 (Khattab et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib10)) 从带标签的示例中合成少样本演示,而 MIPROv2 (Opsahl-Ong et al., 2024 (https://arxiv.org/html/2608.02919#bib.bib13)) 通过对候选建议进行贝叶斯搜索来联合优化指令和演示;GEPA 报告其性能超过了 MIPROv2,这促使我们选择 GEPA 作为主要优化基线。

除了这些通用方法之外,由于检索和生成组件之间的交互,为 RAG 系统优化提示词带来了独特的挑战。Rodrigues 和 Branco (Rodrigues and Branco, 2024 (https://arxiv.org/html/2608.02919#bib.bib16)) 将元提示技术应用于 RAG 流水线以提升端到端性能,而 Opsahl-Ong 等人 (Opsahl-Ong et al., 2024 (https://arxiv.org/html/2608.02919#bib.bib13)) 为多阶段语言模型程序优化指令和演示,在 HotPotQA (Yang et al., 2018 (https://arxiv.org/html/2608.02919#bib.bib20)) 等多跳问答数据集上取得了强劲结果。RAG-Gym (Xiong et al., 2025 (https://arxiv.org/html/2608.02919#bib.bib18)) 则监督检索代理的搜索过程,在包括 HotPotQA 和 2WikiMultiHopQA (Ho et al., 2020 (https://arxiv.org/html/2608.02919#bib.bib6)) 在内的多跳数据集上评估性能。补充方法通过架构创新而非提示词设计来增强 RAG:IRCoT (Trivedi et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib17)) 将检索与思维链推理交错进行,Self-RAG (Asai et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib3)) 学习何时检索并批判性评估检索内容,Active RAG (Jiang et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib8)) 在生成过程中确定何时需要检索,LongRAG (Jiang et al., 2024 (https://arxiv.org/html/2608.02919#bib.bib7)) 利用长上下文 LLM 同时处理更多检索文档,而 Park 等人 (Park et al., 2025 (https://arxiv.org/html/2608.02919#bib.bib14)) 通过提示工程模拟 RAG 行为而无需显式检索器。更通用的框架如 Promptomatix (Murthy et al., 2025 (https://arxiv.org/html/2608.02919#bib.bib12))(我们将其作为基线)和 APE (Zhou et al., 2022 (https://arxiv.org/html/2608.02919#bib.bib21)) 自动搜索提示空间以跨任务合成高性能提示词。最后,在分类方面,Pryzant 等人 (Pryzant et al., 2023 (https://arxiv.org/html/2608.02919#bib.bib15)) 提出了使用梯度下降和束搜索的自动提示词优化,Lieander 等人 (Lieander et al., 2025 (https://arxiv.org/html/2608.02919#bib.bib11)) 引入了一种双梯度方法,结合多种优化信号来改进 LLM 分类。除了研究文献,商业供应商也提供提示词优化工具;我们额外与 OpenAI 的 Prompt Optimizer 进行了比较,222https://developers.openai.com/api/docs/guides/prompt-optimizer
这是一个仪表板工具,根据当前最佳实践重写用户提供的提示词,可选地由数据集注释和评分器结果指导,我们将其作为广泛使用的实践者基线(表中记为 OpenAI)。

算法 1——FLARE
1:训练集 D_tr,验证集 D_val,测试集 D_te,指标 m(⋅)
2:最佳表现提示词 p^⋆
3:初始化 LM L(τ=1.0,k_max=16,000);加载系统指令 s_sys
4:转换数据集:T←φ(D_tr),V←φ(D_val),E←φ(D_te)
5:提取 p_0←Instr(P_0) ;评估 s_0^val←m(p_0; V),s_0^te←m(p_0; E)
6:初始化 p^⋆←p_0,s_best^val←s_0^val,H←∅(窗口大小 l=3)
7:对于 i=1 到 N 执行
8:p←O(p^⋆, T, V, s_sys, s_best^val, H) ⊳ 使用完整训练集 T,而非样本
9:评估 s^val←m(p; V),s^te←m(p; E)
10:将 s^val, s^te 追加到 R_val, R_te ⊳ 仅记录测试集用于报告
11:H←last_ℓ(H∪{(s^val, ψ(p))})
12:如果 s^val > s_best^val 则
13:s_best^val←s^val,p^⋆←p ⊳ 根据验证集选择
14:结束如果
15:结束循环
16:返回 p^⋆ ⊳ 最大化验证集性能的提示词,而非最终迭代的提示词

## 3. FLARE 算法

FLARE 使用 Azure OpenAI 实现了一种迭代的、错误驱动的提示词优化方法。与 GEPA 基于种群的帕累托前沿进化、OpenAI 的单遍最佳实践重写或 Promptomatix 基于合成数据的流水线不同,我们的方法作为一个直接反馈回路运作,其中 LLM 元优化器 O 根据任务特定的验证性能持续改进提示词 p。这种架构使优化器能够从具体的失败模式中学习,而不是依赖种群多样性或合成演示,从而实现有针对性的改进,直接解决模型中观察到的行为弱点。

该过程首先初始化具有固定解码参数(温度 τ=1.0,最大完成令牌数 k_max=16,000)的语言模型 L,并将训练集、验证集和测试集转换为模型兼容的格式:T←φ(D_tr),V←φ(D_val),E←φ(D_te),其中变换 φ 构造具有适当输入输出字段映射的 DSPy Example 对象。从任务特定的签名中提取基础提示词 p_0←Instr(P_0),并通过指标 m(⋅) 评估,以建立基线分数 s_0^val 和 s_0^te。此初始化阶段还涉及计算所有验证示例的预测 y^i←L(p_0, x_i),创建初始错误概况,为第一个优化步骤提供信息。

在 N 次优化迭代中,优化器通过结构化的改进过程更新提示词。在第 t 次迭代时,元优化器接收当前表现最佳的提示词 p_{t-1}^⋆,以及根据验证预测构建的详细反馈。具体来说,对于每个验证示例 (x_i, y_i)∈V,我们计算预测 y^i←L(p_{t-1}^⋆, x_i),并构建错误信号

e_i={CORRECT if m(y^i,y_i)=1; WRONG(y_i,y^i) otherwise}

其中包括真实标签 y_i 和模型的错误预测 y^i。然后优化器生成改进后的提示词,即

p_t←O(p_{t-1}^⋆, T, {(x_i,y_i,e_i)}_{i=1}^{|V|}, s_sys, c_t, H_t),

其中 T 是*完整*的训练集,提供上下文;s_sys 编码任务特定的优化目标(例如,“最大化多标签分类的 F1 分数”);c_t=s_{t-1}^val 是当前验证分数;H_t={(s_j^val, ψ(p_j))}_{j=max(0,t-3)}^{t-1} 维护最近 l=3 次迭代的滑动窗口。元优化器以温度 τ_O=1.0(与评估模型匹配)和最大令牌数 k_O=16,000 运行,保留随机性以鼓励对提示空间的探索。值得注意的是,元优化器和评估模型使用相同的随机解码参数,而不是对评估采用确定性推理。

每次迭代都会重新评估更新后的 p

相似文章

GEPA:反思式提示演化可超越强化学习

Papers with Code Trending

GEPA 是一款提示优化器,利用自然语言反思从试错中学习,在多个任务中,以多达 35 倍的更少 rollout 次数超越了 GRPO 和 MIPROv2 等强化学习方法。

ReGRPO:面向工具使用智能体的反思增强策略优化

arXiv cs.AI

ReGRPO 提出了一种反思增强的策略优化框架,用于工具使用的视觉语言智能体,通过利用结构化的失败观测以及反思令牌与动作的联合优化,来改善从工具故障中的恢复能力,在 GTA 和 GAIA 基准测试上取得了最先进的结果。