FAPO: 多步骤LLM流水线的全自动提示优化

Hugging Face Daily Papers 论文

摘要

FAPO是一个用于多步骤LLM流水线的全自动提示优化框架,结合了提示编辑和结构变化。在18次对比中,它在15次中优于GEPA基线,在安全任务上收益高达+33.8个百分点。

多步骤LLM流水线会因为检索、推理和格式化步骤之间的交互而失败,因此仅优化提示可能无法发现链中的瓶颈。我们提出了FAPO(全自动提示优化),这是一个让Claude Code在标准化代码库中优化LLM流水线的框架。FAPO评估流水线、检查中间步骤、诊断故障、提出局部修改方案,并反复验证变体,以针对评分函数进行优化。它首先尝试提示编辑,只有当提示优化看起来不够时,当归因分析识别出结构瓶颈时,才会在允许范围内改变链结构。在六个基准测试和三个任务模型上,FAPO在18次模型-基准比较中击败了基线GEPA 15次。在11次模型-基准比较中,FAPO以非重叠的均值±试验标准差范围获胜,平均FAPO-GEPA增益为+14.1个百分点。在六次HoVer和IFBench比较中,当提示优先搜索升级为结构变化时,FAPO赢得了全部六次,平均增益为+33.8个百分点。FAPO还提高了安全任务的性能:在CTIBench-RCM(一个安全CVE-to-CWE任务)上,仅使用提示的FAPO在GPT-5上测试准确率提升了+4.0个百分点,在Foundation-Sec-8B-Instruct上提升了+7.1个百分点,在Foundation-Sec-8B-Reasoning上提升了+2.0个百分点。这些结果使FAPO成为通用和安全任务中最先进的流水线优化技术。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:29

论文页面 - FAPO:多步骤 LLM 流程的完全自主提示优化

来源:https://huggingface.co/papers/2606.19605

摘要

FAPO 通过结合提示编辑与结构变更来优化 LLM 流程,在多个基准测试和安全任务中展现出卓越性能。

多步骤 LLM 流程 (https://huggingface.co/papers?q=LLM%20pipelines) 在检索、推理和格式化步骤之间的交互中容易失败,因此仅进行提示优化 (https://huggingface.co/papers?q=prompt-only%20optimization) 可能会遗漏流程链中的瓶颈。我们提出 FAPO (https://huggingface.co/papers?q=FAPO)(完全自主提示优化 (https://huggingface.co/papers?q=Prompt%20Optimization)),一个让 Claude Code (https://huggingface.co/papers?q=Claude%20Code) 在标准化代码库中优化 LLM 流程的框架。FAPO (https://huggingface.co/papers?q=FAPO) 会评估流程、检查中间步骤、诊断失败原因、提出局部修改方案,并反复验证变体,以针对评分函数进行优化。它首先尝试提示编辑,仅当提示优化 (https://huggingface.co/papers?q=prompt%20optimization) 看起来不足时,才在归因识别出结构瓶颈的情况下,在允许的范围内改变流程链结构 (https://huggingface.co/papers?q=chain%20structure)。在六个基准测试和三个任务模型的对比中,FAPO (https://huggingface.co/papers?q=FAPO) 在 18 项模型-基准比较中的 15 项中优于基线 GEPA (https://huggingface.co/papers?q=GEPA)。在 11 项模型-基准比较中,FAPO (https://huggingface.co/papers?q=FAPO) 的平均分 ± 试验标准差范围与 GEPA 不重叠且更优,平均 FAPO (https://huggingface.co/papers?q=FAPO)-GEPA (https://huggingface.co/papers?q=GEPA) 增益为 +14.1 个百分点。在六项 HoVer 和 IFBench 比较中,当先提示搜索 (https://huggingface.co/papers?q=prompt-first%20search) 升级为结构变更 (https://huggingface.co/papers?q=structural%20changes),FAPO (https://huggingface.co/papers?q=FAPO) 六战全胜,平均增益为 +33.8 个百分点。FAPO (https://huggingface.co/papers?q=FAPO) 还能提升安全任务性能:在 CTIBench-RCM (https://huggingface.co/papers?q=CTIBench-RCM)(一个安全 CVE-to-CWE 任务 (https://huggingface.co/papers?q=security%20CVE-to-CWE%20task))上,仅用提示优化的 FAPO (https://huggingface.co/papers?q=FAPO) 将测试准确率提升了:GPT-5 上 +4.0 个百分点,Foundation-Sec-8B-Instruct 上 +7.1 个百分点,Foundation-Sec-8B-Reasoning 上 +2.0 个百分点。这些结果使 FAPO (https://huggingface.co/papers?q=FAPO) 成为通用和安全聚焦任务中一项最先进的流程优化 (https://huggingface.co/papers?q=pipeline%20optimization) 技术。

查看 arXiv 页面 (https://arxiv.org/abs/2606.19605) 查看 PDF (https://arxiv.org/pdf/2606.19605) GitHub20 (https://github.com/cisco-foundation-ai/fully-automated-prompt-optimization) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19605)

在你的 agent 中获取此论文:

hf papers read 2606.19605

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.19605 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.19605 即可从此页面链接。

引用此论文的 Spaces 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.19605 即可从此页面链接。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

APPO: 智能体过程策略优化

Hugging Face Daily Papers

APPO通过使用细粒度决策点和过程级优势缩放来改进分支决策和信用分配,从而提升LLM智能体的多轮工具使用能力,在13个基准测试中比基线高出近4个百分点。

自监督提示优化

Papers with Code Trending

本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。

SePO:用于系统提示优化的自进化提示智能体

arXiv cs.CL

SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。

SPEAR:代码增强的智能体提示优化

arXiv cs.CL

SPEAR 是一个代码增强的智能体提示优化器,它利用 Python 沙箱进行结构错误分析,在包括工业裁判任务、BBH 和 GSM8K 在内的多个 LLM 评估套件上取得了最先进的性能。