BayesPO: 基于并行回火梯度引导离散MCMC的贝叶斯提示优化
摘要
本文提出BayesPO,一种使用梯度引导离散MCMC与并行回火的贝叶斯提示优化框架,在指令归纳任务上提升了准确率。
arXiv:2607.16001v1 公告类型: 新
摘要: 提示优化在不更新模型参数的情况下适配大型语言模型(LLM),但许多自动提示优化器仍是基于候选指令的启发式搜索过程。本文将提示优化建模为离散提示令牌上的贝叶斯后验采样。我们定义了一个后验分布,结合了任务似然项(奖励能解释输入-输出示例的提示)和语言模型先验(倾向于流畅指令)。这便将提示优化转化为基于能量的后验采样问题,其中梯度可用于指导词汇令牌上的离散马尔可夫链蒙特卡洛(MCMC)提议。我们将该框架称为BayesPO(贝叶斯提示优化)。本文中,BayesPO通过马尔可夫链蒙特卡洛实例化:使用经过Metropolis-Hastings校正的Gibbs-with-Langevin (GwL)提议,并集成并行回火以在LLM诱导的粗糙能量景观中进行全局探索。该具体采样器进一步将GwL采样器适配到非权重共享LLM嵌入的实际约束。使用Qwen2.5模型的实验表明,该采样器能在诊断任务中发现语义有意义的提示;并行回火有助于在诗歌补全任务中逃离局部最优;对24个指令归纳子任务上的APE提示进行后优化,平均准确率从60.04%提升至63.23%。研究还揭示了两项主要局限:能量最小化可能过拟合小规模优化集,且当前采样器计算成本仍较高。这些发现将贝叶斯提示采样定位为一种原则性的后优化工具,并为概率化提示优化指明了有前景的方向。
查看缓存全文
缓存时间: 2026/07/20 09:36
# BayesPO:基于并行回火梯度引导离散MCMC的贝叶斯提示优化 来源:https://arxiv.org/abs/2607.16001 查看PDF (https://arxiv.org/pdf/2607.16001) > 摘要:提示优化(Prompt optimization)使大型语言模型(LLMs)适应任务而无需更新模型参数,但许多自动提示优化器仍然是对候选指令进行启发式搜索的过程。本文将提示优化研究为对离散提示令牌进行贝叶斯后验采样。我们定义了一个后验分布,结合了任务似然项(奖励解释输入-输出示例的提示)和语言模型先验(倾向于流畅的指令)。这将提示优化转化为基于能量的后验采样问题,可以利用梯度引导离散词汇令牌上的马尔可夫链蒙特卡洛(MCMC)提议。我们将该框架称为BayesPO,即贝叶斯提示优化的缩写。在本文中,BayesPO通过马尔可夫链蒙特卡洛实现:它使用梅特罗波利斯-黑斯廷斯校正的带有朗之万项的吉布斯采样(GwL)提议,并集成了并行回火以对LLM诱导的崎岖能量景观进行全局探索。该具体采样器进一步将GwL采样器适应于非权重绑定LLM嵌入的实际约束。使用Qwen2.5模型的实验表明,该采样器在诊断任务上发现语义有意义的提示,并行回火有助于在诗歌补全任务中逃离局部最优,以及在24个指令归纳子任务上对APE提示进行后优化,将平均准确率从60.04%提升到63.23%。该研究还揭示了两大局限:能量最小化可能过拟合小规模优化集,且当前采样器在计算上仍然昂贵。这些发现将贝叶斯提示采样定位为一种原则性的后优化工具,并指向了概率提示优化的有希望的方向。 ## 提交历史 来自:Zhijian Ou \[查看电子邮件 (https://arxiv.org/show-email/9b1f72a5/2607.16001)\] **\[v1\]** 2026年7月17日星期五 14:39:05 UTC (1,506 KB)
相似文章
通过预测梯度催化剂加速多目标贝叶斯优化
本文介绍了一种通用加速机制,用于多目标贝叶斯优化,该机制利用高斯过程预测梯度作为辅助信号来增强现有的采集函数,从而在有限的评估预算下更快地收敛到全局帕累托集。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
自监督提示优化
本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。
SePO:用于系统提示优化的自进化提示智能体
SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。
SAGE:基于智能体引导的随机提示优化
介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。