CRAFT:提示词的成本感知精化与前端感知调优

arXiv cs.CL 论文

摘要

CRAFT 是一种帕累托前沿提示优化器,通过使用 NSGA-II 和预算感知验证,在准确率-成本权衡前沿上维持多样化的提示种群,从而联合优化准确率与 token 成本,同时避免加权求和方法所导致的"标量化坍塌"问题。

arXiv:2606.04661v1 公告类型:新论文 摘要:为追求高准确率而调优的提示词往往会变得很长,导致每次模型调用的推理成本上升。最优的准确率-成本权衡取决于具体任务和预算约束,因此提示词优化本质上是在准确率与提示词 token 成本的帕累托前沿上进行搜索,而非寻找单一最优提示词。常见的简化做法——将多目标折叠为加权求和——在搜索前就固定了权衡系数,往往只能恢复前沿的一个狭窄区域,我们将这一缺陷称为"标量化坍缩"。我们提出 CRAFT(Cost-aware Refinement And Front-aware Tuning,成本感知精炼与前沿感知调优),这是一种帕累托前沿提示词优化器,将目标 LLM 的验证调用视为稀缺资源,并将其分配给位于乐观候选前沿附近的候选方案。每轮迭代中,面向准确率的生成器与面向成本的生成器协同提出编辑方案,帕累托间隙采集策略负责分配每轮验证预算,NSGA-II 保留机制则维持种群的多样性分布。在六个分类与推理基准测试上,CRAFT 保留的前沿同时覆盖高准确率和低成本区域,而仅优化准确率、仅优化成本以及加权求和的基线方法均只集中于更窄的区域。准确率与成本之间的权衡成为搜索完成后的选择,而非搜索开始前的预设权重。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:16

# CRAFT:提示词的成本感知优化与帕累托前沿调优

来源:https://arxiv.org/html/2606.04661

Shanu Kumar¹,Shubhanshu Khandelwal²,Akhila Yesantarao Venkata²,Parag Agrawal²,Yova Kementchedjhieva¹,Manish Gupta²
¹MBZUAI ²Microsoft
\{shanu\.kumar,yova\.kementchedjhieva\}@mbzuai\.ac\.ae
\{shukhand,akyesant,paragag,gmanish\}@microsoft\.com

###### 摘要

针对准确率优化的提示词往往越来越长,导致每次模型调用的推理成本上升。准确率与成本之间的最优权衡取决于具体任务和预算,因此提示词优化本质上是对准确率与提示词 token 成本所构成的*帕累托前沿*进行搜索,而非寻找单一最优提示词。常见的简化方法——将多个目标合并为加权和——在搜索前便固定了权重,往往只能覆盖帕累托前沿的一小部分区域,我们将这一缺陷称为*标量化崩溃*。我们提出 CRAFT(Cost-aware Refinement And Front-aware Tuning,成本感知优化与前沿感知调优),这是一种面向帕累托前沿的提示词优化器,将目标 LLM 的验证调用视为稀缺资源,并将其优先分配给乐观候选前沿附近的候选者。每轮迭代中,面向准确率和面向成本的互补生成器分别提出编辑方案,帕累托间隙采集策略在每轮验证预算内进行分配,NSGA-II 保留机制则维护一个分布均匀的种群。在六个分类与推理基准测试中,CRAFT 保留的前沿既能覆盖高准确率区域,也能覆盖低成本区域,而仅面向准确率、仅面向成本以及加权和基线方法各自只能集中在较窄的区域内。准确率与成本之间的权衡成为搜索完成后的选择,而非搜索前需要预先设定的权重。

CRAFT:提示词的成本感知优化与前沿感知调优

Shanu Kumar¹,Shubhanshu Khandelwal²,Akhila Yesantarao Venkata²,Parag Agrawal²,Yova Kementchedjhieva¹,Manish Gupta²
¹MBZUAI ²Microsoft
\{shanu\.kumar,yova\.kementchedjhieva\}@mbzuai\.ac\.ae
\{shukhand,akyesant,paragag,gmanish\}@microsoft\.com

## 1 引言

大型语言模型(LLM)通过调整输入模型的自然语言提示词来适应下游任务(Ramnath 等,2025 (https://arxiv.org/html/2606.04661#bib.bib263))。更长、结构更复杂的提示词每次调用成本更高,而微小的编辑也会对预测结果产生不成比例的影响(Jiang 等,2020 (https://arxiv.org/html/2606.04661#bib.bib209);Zhao 等,2021 (https://arxiv.org/html/2606.04661#bib.bib207)),这促使了自动提示词优化研究的发展。

现有工作主要沿两条路线展开。面向准确率的优化器,如 OPRO(Yang 等,2024 (https://arxiv.org/html/2606.04661#bib.bib9))、ProTeGi(Pryzant 等,2023 (https://arxiv.org/html/2606.04661#bib.bib15))、SCULPT(Kumar 等,2025 (https://arxiv.org/html/2606.04661#bib.bib234))和 EvoPrompt(Guo 等,2024 (https://arxiv.org/html/2606.04661#bib.bib19)),以最大化任务准确率为目标;提示词压缩方法,如 Gist tokens(Mu 等,2023 (https://arxiv.org/html/2606.04661#bib.bib249))、LLMLingua 和 LLMLingua-2(Jiang 等,2023 (https://arxiv.org/html/2606.04661#bib.bib236);Pan 等,2024 (https://arxiv.org/html/2606.04661#bib.bib230)),则通过减少 token 数量来降低每次调用的推理成本(Chen 等,2024 (https://arxiv.org/html/2606.04661#bib.bib247))。这两类方法都将提示词的好坏归结为单一维度,但准确率相近而长度不同的两个提示词并不等价:每多一个 token 就意味着每次模型调用都额外增加推理成本,因此准确率与成本是相互耦合的。

**图 1**:BeaverTails 数据集上的准确率-成本权衡。SCULPT(仅准确率)、LLMLingua(仅成本)和 WPRO₀.₅(加权和)各自只能覆盖帕累托前沿的一小段区域。CRAFT(我们的方法)能够同时覆盖前沿的高准确率区域和低 token 区域。

这一问题本质上是一个多目标提示词优化问题。两个目标往往相互冲突:更高的准确率通常需要更详细的提示词,而更低的成本则倾向于简洁。提示词文本与准确率、成本之间的关系是非凸的,提示词空间也是离散的(Wen 等,2024 (https://arxiv.org/html/2606.04661#bib.bib6);Jiang 等,2020 (https://arxiv.org/html/2606.04661#bib.bib209);Zhao 等,2021 (https://arxiv.org/html/2606.04661#bib.bib207)),因此固定标量奖励会遗漏权衡曲面上的部分区域(Das 和 Dennis,1997 (https://arxiv.org/html/2606.04661#bib.bib258))。我们转而直接对准确率-成本帕累托前沿进行优化,将其定义为没有其他提示词在准确率更高的同时长度更短的提示词集合。

算法层面的挑战不仅仅在于如何从已评估的权衡方案中做出选择,还在于决定评估什么:每个候选提示词的准确率都需要目标 LLM 的验证调用,因此优化器必须在候选提示词的真实前沿位置未知的情况下,在每轮验证预算内做出分配决策。在搜索前优化固定标量奖励往往只能恢复前沿的一小部分区域,即上述的*标量化崩溃*问题。

我们提出 CRAFT(Cost-aware Refinement And Front-aware Tuning),这是一个面向前沿的优化循环:精炼器(refiner)和压缩器(condenser)以互补的准确率偏好和成本偏好生成编辑方案;帕累托间隙采集(Srinivas 等,2009 (https://arxiv.org/html/2606.04661#bib.bib245);Daulton 等,2021 (https://arxiv.org/html/2606.04661#bib.bib246))将每轮验证预算分配给乐观候选前沿附近的候选者;非支配排序遗传算法 II(NSGA-II)保留机制(Deb 等,2002 (https://arxiv.org/html/2606.04661#bib.bib240))则为下一轮保留一个多样化的已验证种群。图 1 (https://arxiv.org/html/2606.04661#S1.F1) 直观展示了二者的对比:仅面向准确率、仅面向成本以及加权和基线各自只能集中在前沿的一小段区域,而 CRAFT 能够覆盖前沿的两端。

我们的贡献如下:(i) 我们将成本感知提示词优化形式化为对准确率与提示词 token 成本的有预算帕累托前沿搜索问题,其中目标 LLM 验证调用决定了哪些候选权衡方案可以被观测到;(ii) 我们提出 CRAFT,¹¹代码:https://github.com/Sshanu/CRAFT 一个将候选生成与验证分配解耦的前沿感知框架,以互补的面向准确率和面向成本的生成器、帕累托间隙采集以及 NSGA-II 保留机制构成一个有预算的循环;(iii) 我们证明,面向准确率、面向成本以及加权和基线方法均只能集中在前沿的狭窄区域,而 CRAFT 在六个基准测试中能够保留覆盖高准确率和低成本部分的可行提示词,并可跨优化器 LLM 迁移。

**图 2**:CRAFT 框架。每轮迭代中,精炼器和压缩器从上一轮种群 $\mathcal{P}_{t-1}$ 生成新的候选提示词;帕累托间隙采集在每轮验证预算内对候选提示词进行验证;NSGA-II 选择器保留非支配的、分布均匀的种群 $\mathcal{P}_t$ 用于下一轮。整个循环重复 $R$ 轮。

## 2 相关工作

##### 提示词优化。

提示词优化器按照所使用的优化信号可分为四类:(1) LLM 编辑方法,通过另一个 LLM 重写提示词(Yang 等,2024 (https://arxiv.org/html/2606.04661#bib.bib9);Pryzant 等,2023 (https://arxiv.org/html/2606.04661#bib.bib15);Kumar 等,2025 (https://arxiv.org/html/2606.04661#bib.bib234));(2) 梯度或程序化方法,通过可微分或符号化计算图传播信号(Yuksekgonul 等,2025 (https://arxiv.org/html/2606.04661#bib.bib21);Khattab 等,2024 (https://arxiv.org/html/2606.04661#bib.bib22));(3) 基于强化学习的方法(Deng 等,2022 (https://arxiv.org/html/2606.04661#bib.bib235));(4) 进化变异与选择方法(Guo 等,2024 (https://arxiv.org/html/2606.04661#bib.bib19);Fernando 等,2024 (https://arxiv.org/html/2606.04661#bib.bib20))。大多数方法在原始文本 token 层面操作,难以表达大规模结构性编辑。少数优化器在编译期或树级抽象层面进行编辑(Schnabel 和 Neville,2024 (https://arxiv.org/html/2606.04661#bib.bib23);Kumar 等,2025 (https://arxiv.org/html/2606.04661#bib.bib234))。CRAFT 沿用这一结构感知路线,以 SCULPT(Kumar 等,2025 (https://arxiv.org/html/2606.04661#bib.bib234))作为默认精炼器(§3.2 (https://arxiv.org/html/2606.04661#S3.SS2)),因其在准确率导向方面表现突出,且支持即插即换,相关替换实验见表 1 (https://arxiv.org/html/2606.04661#S5.T1)。

##### 提示词压缩。

token 级压缩器通过删除低信息量的表层 token 来缩短长度(Mu 等,2023 (https://arxiv.org/html/2606.04661#bib.bib249);Jiang 等,2023 (https://arxiv.org/html/2606.04661#bib.bib236);Pan 等,2024 (https://arxiv.org/html/2606.04661#bib.bib230))。由于这类方法在指令或约束层面以下操作,激进的压缩可能删除任务关键内容,限制了其作为帕累托前沿循环中成本导向模块的价值。能够编辑解析后提示词树的结构感知压缩器可以避免这一问题,但据我们所知目前尚无相关工作;我们为此引入了 DISTILL(§3.3 (https://arxiv.org/html/2606.04661#S3.SS3)),作为 CRAFT 的成本导向生成器。

##### 多目标提示词优化。

现有的多目标提示词优化器(Jafari 等,2024 (https://arxiv.org/html/2606.04661#bib.bib231);Menchaca Resendiz 和 Klinger,2025 (https://arxiv.org/html/2606.04661#bib.bib242);Zhao 等,2025 (https://arxiv.org/html/2606.04661#bib.bib233);Yang 和 Li,2023 (https://arxiv.org/html/2606.04661#bib.bib232);Agrawal 等,2026 (https://arxiv.org/html/2606.04661#bib.bib243))优化多目标奖励,但并未研究在每个候选提示词的准确率需要通过目标 LLM 验证调用来估计、且固定预算只能覆盖离散提示词空间的一部分时,如何构建帕累托前沿。CRAFT 正是针对这一有预算的前沿构建场景,专注于准确率与提示词 token 成本之间的权衡。最接近的成本感知优化器是 CAPO(Cost-Aware Prompt Optimization)(Zehle 等,2025 (https://arxiv.org/html/2606.04661#bib.bib261));我们将其固定权重标量化方案作为 WPRO 基线,由此产生的标量化崩溃现象如图 1 (https://arxiv.org/html/2606.04661#S1.F1) 所示。

##### 多目标贝叶斯优化与成本感知推理。

多目标贝叶斯优化(Knowles,2006 (https://arxiv.org/html/2606.04661#bib.bib244);Srinivas 等,2009 (https://arxiv.org/html/2606.04661#bib.bib245);Daulton 等,2021 (https://arxiv.org/html/2606.04661#bib.bib246))为我们的问题提供了理论框架,但其假设数值型设计空间和高斯过程代理模型,这两者均不适用于离散文本场景;因此需要基于部分验证分数的采集规则。成本感知 LLM 推理(Chen 等,2024 (https://arxiv.org/html/2606.04661#bib.bib247);Yue 等,2024 (https://arxiv.org/html/2606.04661#bib.bib248))在推理时将输入路由至不同模型,与提示词优化相互独立。

## 3 CRAFT 框架

CRAFT 维护一个小型提示词种群,逐轮将其塑造为准确率-成本帕累托前沿的近似。每轮包含三个步骤:结构感知精炼器和压缩器提出新的候选提示词(§3.2 (https://arxiv.org/html/2606.04661#S3.SS2),§3.3 (https://arxiv.org/html/2606.04661#S3.SS3));帕累托间隙采集函数将每轮验证预算分配给乐观候选前沿附近的候选提示词(§3.4 (https://arxiv.org/html/2606.04661#S3.SS4));种群选择器保留 $k$ 个分布于前沿的提示词用于下一轮(§3.5 (https://arxiv.org/html/2606.04661#S3.SS5))。图 2 (https://arxiv.org/html/2606.04661#S1.F2) 展示了整个循环。

### 3.1 问题形式化

我们将提示词优化建模为对任务准确率得分和提示词 token 成本的双目标搜索问题。设 $\mathcal{D}_{\mathrm{val}}$ 和 $\mathcal{D}_{\mathrm{test}}$ 分别为验证集和保留测试集,大小分别为 $N_{\mathrm{val}}$ 和 $N_{\mathrm{test}}$。对于提示词 $P$ 和子集 $\mathcal{V} \subseteq \mathcal{D}_{\mathrm{val}}$,$p(P;\mathcal{V})$ 表示在 $\mathcal{V}$ 上的任务得分。对于候选提示词 $P_i$,我们用 $p_i = p(P_i;\mathcal{D}_{\mathrm{val}})$ 表示其完整验证得分(搜索最终优化的目标),用 $c_i = c(P_i)$ 表示其成本,即提示词的 token 数量,不含示例输入和模型输出。搜索过程中 $p_i$ 通过部分验证来估计(§3.4 (https://arxiv.org/html/2606.04661#S3.SS4)),保留测试集得分则用于最终报告(附录 B.1 (https://arxiv.org/html/2606.04661#A2.SS1))。

两个目标之间存在张力,因此不存在统一最优的单一提示词。若提示词 $P_i$ 在两个目标上均不劣于 $P_j$、且在至少一个目标上严格优于 $P_j$,则称 $P_i$ *支配* $P_j$,记为 $P_i \succ P_j$:即 $p_i \geq p_j$ 且 $c_i \leq c_j$,至少有一个严格不等式成立。集合 $\mathcal{C}$ 中不被任何其他提示词支配的提示词构成其*帕累托最优集* $\mathcal{C}^*$,CRAFT 的目标是在每轮 LLM 调用预算固定的约束下,在离散的 LLM 提示词空间中近似 $\mathcal{C}^*$。

CRAFT 从单个人工编写的提示词出发,迭代构建这一近似。第 $t$ 轮以包含 $k$ 个提示词的保留种群 $\mathcal{P}_{t-1}$ 开始。精炼器和压缩器将其扩展为候选集 $\mathcal{Q}_t$;采集函数对 $\mathcal{Q}_t$ 中有预算的子集进行验证;选择器保留 $k$ 个已验证提示词作为下一轮种群 $\mathcal{P}_t$。经过 $R$ 轮后,$\mathcal{P}_R$ 即为返回的前沿近似结果。

### 3.2 精炼器

CRAFT 从两个具有相反偏好的模块中采集候选提示词。单纯优化准确率会导致提示词越来越长;单纯优化成本则会剥离任务相关信号。面向准确率的*精炼器*(本节)以提高任务准确率为目标,面向成本的*压缩器*(§3.3 (https://arxiv.org/html/2606.04661#S3.SS3))以降低提示词 token 成本为目标;将两者同时保留在种群中,使选择器能够在二者之间进行权衡。

精炼器可以是任何与每轮预算接口兼容的面向准确率的提示词优化器;SCULPT、OPRO 和 EvoPrompt 均可在此角色中互换使用。我们默认使用 SCULPT,原因有二:一是已有研究表明其在更广泛的基准测试集上的泛化能力优于 OPRO(Kumar 等,2025 (https://arxiv.org/html/2606.04661#bib.bib234));二是其树级编辑精确且稳定。SCULPT 的评判者-执行者(critic-actor)架构(附录 A.3 (https://arxiv.org/html/2606.04661#A1.SS3),图 8 (https://arxiv.org/html/2606.04661#A1.F8))将提示词解析为由章节、规则和示例组成的层次化树结构;评判者-执行者对通过重排序、扩展或澄清节点来编辑该树,每轮每个提示词最多生成 $n_R$ 个变体。SCULPT、OPRO 和 EvoPrompt 的提示词模板及超参数详见附录 A.3 (https://arxiv.org/html/2606.04661#A1.SS3)。

### 3.3 压缩器

压缩器在保留任务相关指令的同时降低提示词 token 成本。我们默认的 DISTILL 复用了 SCULPT 的评判者-执行者架构,以其精确性和稳定性为基础,天然具备结构感知能力。LLMLingua-2 等 token 级压缩器通过删除低信息量的表层 token 来压缩内容,可能丢弃任务关键指令;DISTILL 则改为编辑解析后的提示词树:评判者标记冗余或啰嗦的子结构,执行者应用表 6 (https://arxiv.org/html/2606.04661#A1.T6) 中列出的树级编辑操作,包括更新、删除或合并节点。每轮迭代中,每个提示

相似文章

自监督提示优化

Papers with Code Trending

本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。

PrompTessor

Product Hunt

PrompTessor 是一个AI提示词生成器、优化器和库,帮助用户编写有效的提示词。