自监督提示优化
摘要
本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。
查看缓存全文
缓存时间: 2026/05/08 08:59
论文页面 - 自监督提示词优化
来源:https://huggingface.co/papers/2502.06855
摘要
一种自监督框架,通过无需外部参考地评估 LLM 输出来优化封闭式和开放式任务的提示词,从而降低成本并减少所需数据。
精心设计的提示词对于提升大语言模型(LLMs)的推理能力以及使其输出与各领域任务要求保持一致至关重要。然而,手动设计提示词需要专业知识并反复实验。虽然现有的提示词优化(prompt optimization)方法旨在自动化这一过程,但它们严重依赖外部参考(如真实标签或人工标注),这限制了其在缺乏此类数据或获取成本高昂的实际场景中的应用。为此,我们提出了自监督提示词优化(Self-Supervised Prompt Optimization, SPO),一种经济高效的框架,能够在无需外部参考的情况下为封闭式和开放式任务发现有效的提示词。基于以下观察:提示词质量直接体现在 LLM 输出中,且 LLM 能够有效评估输出是否符合任务要求,我们纯粹通过输出比较来推导评估和优化信号。具体而言,SPO 首先通过 LLM 评估器(LLM evaluator)进行成对输出比较来筛选优质提示词,然后利用 LLM 优化器(LLM optimizer)使输出与任务要求对齐。大量实验表明,SPO 优于最先进的提示词优化方法,以显著更低的成本(例如,仅为现有方法的 1.1% 至 5.6%)和更少的样本(例如,仅三个样本)取得了相当或更优的结果。代码可在 https://github.com/geekan/MetaGPT 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2502.06855) 查看 PDF (https://arxiv.org/pdf/2502.06855) GitHub 67.8k auto (https://github.com/geekan/metagpt) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2502.06855)
在您的智能体中获取这篇论文:
hf papers read 2502.06855
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2502.06855 即可从此页面链接。
引用该论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2502.06855 即可从此页面链接。
引用该论文的 Spaces 4
包含该论文的收藏集 16
浏览包含该论文的 16 个收藏集 (https://huggingface.co/collections?paper=2502.06855)
相似文章
SePO:用于系统提示优化的自进化提示智能体
SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。
从单体到模块化:段级自动提示词优化
本文介绍了SAPO,一种分段级自动提示优化方法,它将提示分解为角色、上下文、任务和输出格式,然后基于弱示例和强示例进行针对性改进。在多个基准测试上的评估表明,SAPO在GPT-3.5-Turbo和GPT-4o-mini上优于包括APE、OPRO、EvoPrompt、GEPA和StraGO在内的强APO基线。
SAGE:基于智能体引导的随机提示优化
介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。
RLMOpt:基于递归语言模型的自适应提示优化
RLMOpt 是一种提示优化器,它使用递归语言模型来驱动搜索策略本身,在多个基准测试上优于 GEPA 等现有方法,同时使用更少的 rollouts 并生成更短的提示。
自监督技能优化
本文介绍了自监督技能优化(SSO),这是一个利用LLM评判的成对比较,从未标注的任务实例中学习和优化可复用智能体技能的框架,无需真实标签或奖励。SSO在封闭式基准测试上优于现有的无真实标签提示优化器,并接近基于真实标签的方法。