GEPA:反思式提示演化可超越强化学习

Papers with Code Trending 论文

摘要

GEPA 是一款提示优化器,利用自然语言反思从试错中学习,在多个任务中,以多达 35 倍的更少 rollout 次数超越了 GRPO 和 MIPROv2 等强化学习方法。

大语言模型(LLM)越来越多地通过强化学习(RL)方法(如 Group Relative Policy Optimization(GRPO))适应下游任务,这些方法通常需要数千次 rollout 来学习新任务。我们认为,与从稀疏标量奖励中导出的策略梯度相比,语言的可解释性通常可以为 LLM 提供更丰富的学习媒介。为了验证这一点,我们引入了 GEPA(Genetic-Pareto),一种提示优化器,它充分利用自然语言反思从试错中学习高层规则。给定任何包含一个或多个 LLM 提示的 AI 系统,GEPA 采样系统级轨迹(例如推理、工具调用和工具输出),并以自然语言反思这些轨迹,以诊断问题、提出并测试提示更新,并从自身尝试的帕累托前沿中整合互补经验。由于 GEPA 的设计,它通常能够仅用少量 rollout 就能带来大的质量提升。在四个任务中,GEPA 平均比 GRPO 高出 10%,最高达 20%,同时使用的 rollout 次数最多减少 35 倍。GEPA 在两个 LLM 上也超过了领先的提示优化器 MIPROv2 超过 10%,并展示了作为代码优化推理时搜索策略的良好前景。
查看原文
查看缓存全文

缓存时间: 2026/05/19 12:37

论文页面 - GEPA:反思性提示进化可超越强化学习

来源:https://huggingface.co/papers/2507.19457 发布于 2025年7月25日

#3 今日论文 (https://huggingface.co/papers/date/2025-07-28) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

GEPA 是一种利用自然语言反思的提示优化器,通过从试错中学习高层规则,在更少的采样次数下超越了 GRPO 和 MIPROv2 等强化学习方法。

大型语言模型 (https://huggingface.co/papers?q=Large%20language%20models)(LLM)越来越多地通过强化学习 (https://huggingface.co/papers?q=reinforcement%20learning)(RL)方法(如组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO (https://huggingface.co/papers?q=GRPO)))来适配下游任务,这些方法通常需要数千次采样才能学习新任务。我们认为,与源于稀疏标量奖励的策略梯度相比,语言的可解释性通常可以为 LLM 提供更丰富的学习媒介。为了验证这一点,我们引入了 GEPA (https://huggingface.co/papers?q=GEPA)(遗传-帕累托 (https://huggingface.co/papers?q=Genetic-Pareto)),这是一种提示优化器,它全面融入了自然语言反思 (https://huggingface.co/papers?q=natural%20language%20reflection),以从试错中学习高层规则。给定任何包含一个或多个 LLM 提示的 AI 系统,GEPA (https://huggingface.co/papers?q=GEPA) 会采样系统级轨迹 (https://huggingface.co/papers?q=system-level%20trajectories)(例如推理、工具调用和工具输出),并以自然语言对其进行反思,以诊断问题、提出并测试提示更新,以及从其自身尝试的帕累托前沿 (https://huggingface.co/papers?q=Pareto%20frontier) 中整合互补经验。得益于 GEPA (https://huggingface.co/papers?q=GEPA) 的设计,它通常只需少量采样即可实现大幅质量提升。在四项任务中,GEPA (https://huggingface.co/papers?q=GEPA) 平均优于 GRPO (https://huggingface.co/papers?q=GRPO) 10%,最高可达 20%,同时使用的采样次数最多减少 35 倍。GEPA (https://huggingface.co/papers?q=GEPA) 还优于领先的提示优化器 (https://huggingface.co/papers?q=prompt%20optimizer) MIPROv2,在两个 LLM 上均超过 10%,并在代码优化 (https://huggingface.co/papers?q=code%20optimization) 方面展现出作为推理时搜索策略的良好前景。

查看 arXiv 页面 (https://arxiv.org/abs/2507.19457)查看 PDF (https://arxiv.org/pdf/2507.19457)项目页面 (https://gepa-ai.github.io/gepa/)GitHub4.51k (https://github.com/gepa-ai/gepa)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2507.19457)

在您的 agent 中获取此论文:

hf papers read 2507\.19457

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

pirola/local-ai-coding-stack-research (https://huggingface.co/pirola/local-ai-coding-stack-research)

引用此论文的数据集0

没有数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2507.19457,以便从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2507.19457,以便从此页面链接。

包含此论文的收藏集5

浏览包含此论文的 5 个收藏集 (https://huggingface.co/collections?paper=2507.19457)

相似文章

基于环境的LLM游戏智能体自动提示优化

arXiv cs.CL

介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。

提示驱动探索

arXiv cs.LG

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

SePO:用于系统提示优化的自进化提示智能体

arXiv cs.CL

SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。

ReGRPO:面向工具使用智能体的反思增强策略优化

arXiv cs.AI

ReGRPO 提出了一种反思增强的策略优化框架,用于工具使用的视觉语言智能体,通过利用结构化的失败观测以及反思令牌与动作的联合优化,来改善从工具故障中的恢复能力,在 GTA 和 GAIA 基准测试上取得了最先进的结果。