从错误到规则:文本分类的迭代提示优化

arXiv cs.AI 论文

摘要

本文介绍了ERGO,一种面向文本分类中迭代提示优化的错误驱动方法,该方法诊断分类失败并生成有针对性的决策规则,在错误集中于特定混淆标签对的任务上取得了最佳准确率。

arXiv:2607.20497v1 公告类型:新 摘要:文本分类的提示优化涵盖了多种方法,从示例选择到基于探索的搜索再到错误驱动的诊断,每种方法都有已知但未完全描述的优缺点。我们通过定量评估和优化轨迹的定性分析,在多个分类基准(2到150类)上进行了全面的实证研究,比较了这些范式,揭示了每种范式在不同结构类型的任务上表现出色,且没有任何单一方法占据主导地位。基于这些见解,我们提出了错误引导优化(ERGO),一种错误驱动的方法,它在不重叠的批次中迭代整个训练集,诊断分类失败,并通过诊断-处方-重写反馈循环生成有针对性的决策规则。ERGO在错误集中于特定混淆标签对(我们称之为边界可学习任务)的任务上取得了最佳准确率:TREC: 90.0%,CLINC150: 94.4%,在3-5次迭代内收敛,并生成可解释的决策规则。虽然ERGO并未达到最高总体平均值,但它起到了互补作用:基于示例的ICL在覆盖依赖型任务上胜出,基于探索的搜索在多类别意图任务上胜出,而ERGO在决策边界可从错误模式中学习的任务上胜出。我们提供了一个将任务特征与最优范式选择联系起来的互补框架,为实践者提供了实用指导。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:03

# 从错误到规则:文本分类的迭代式提示优化  
来源:https://arxiv.org/html/2607.20497  

###### 摘要  

提示优化在文本分类中涉及多种方法,从示例选择到基于探索的搜索,再到错误驱动诊断,每种方法都有已知但尚未完全厘清的优劣势。本文通过涵盖 2 到 150 个类别的多种分类基准,对这些范式进行了全面的实证研究,综合定量评估和优化轨迹的定性分析,揭示出每种范式在结构不同的任务类型上表现优异,且没有单一方法占据绝对优势。基于这些洞察,我们提出错误引导优化(ERGO),这是一种错误驱动方法:在整个训练集上以非重叠批次迭代,诊断分类失败,并通过“诊断—建议—重写”反馈循环生成针对性的决策规则。在错误集中于特定混淆标签对(我们称之为边界可学习任务)的任务上,ERGO 取得了最佳准确率:TREC 90.0%、CLINC150 94.4%,且在 3–5 次迭代内收敛,并生成可解释的决策规则。虽然 ERGO 并未取得最高的总体平均准确率,但它填补了互补角色:基于示例的 ICL 在依赖覆盖范围的任务上胜出,基于探索的搜索在多类别意图任务上胜出,而 ERGO 在可从错误模式中学习决策边界的任务上胜出。我们提供了一个互补性框架,将任务特征与最优范式选择关联起来,为实践者提供实用指导。

---

## 从错误到规则:文本分类的迭代式提示优化  
**Yueying Cui  Renhao Xue  Yi Zhang  Mukul Prasad**  
Amazon Web Services  

## 1 引言  

文本分类的提示优化产生了丰富的方法,从示例选择(Liu et al., 2022 (https://arxiv.org/html/2607.20497#bib.bib5))到基于探索的搜索(Zhou et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib15));Khattab et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib32))再到错误驱动诊断(Pryzant et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib35))。与需要大量标注数据的微调模型(Devlin et al., 2019 (https://arxiv.org/html/2607.20497#bib.bib6));Botunac et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib14))不同,这些方法在少样本场景下运作(Sahoo et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib11)),但它们体现了根本不同的优化策略。现有的比较通常关注总体准确率,而未分析每种方法何时以及为何表现出色(Li et al., 2025 (https://arxiv.org/html/2607.20497#bib.bib19));Ramnath et al., 2025 (https://arxiv.org/html/2607.20497#bib.bib20))。近期发现提示优化“与抛硬币在统计上无法区分”(Zhang et al., 2026 (https://arxiv.org/html/2607.20497#bib.bib40))进一步凸显了需深入了解哪些任务受益于哪种范式。我们通过覆盖多种分类基准(2–150 类)的全面实证研究来解决这一空白,比较三种范式:选择多样化少样本示例的示例选择方法(Liu et al., 2022 (https://arxiv.org/html/2607.20497#bib.bib5));Yu et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib3)),搜索指令-示例组合的基于探索的方法(DSPy (Khattab et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib32))、GEPA (Agrawal et al., 2026 (https://arxiv.org/html/2607.20497#bib.bib34))、APE (Zhou et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib15))),以及我们提出的基于诊断的方法(ERGO),该方法利用分类错误生成针对性的决策规则。我们的分析揭示,这些范式是互补而非竞争的:每种范式在结构不同的任务类型上表现出色,且没有单一方法占主导。我们提出错误引导优化(ERGO),它在整个训练集上使用诊断 → 建议 → 重写的元提示进行迭代:每次迭代,ERGO 对一个批次进行分类,识别混淆标签对,并生成明确的决策规则。与将准确率视为黑盒信号的基于探索的方法不同,ERGO 根据实际的错误模式联合优化指令、示例和分类指南,生成编码任务内在知识的可解释规则。ERGO 在边界可学习任务上提供了独特价值,这类任务中分类错误集中在特定的混淆对上,适合用自然语言规则处理。在此类任务上,ERGO 取得了最佳准确率(TREC:90.0%,CLINC150:94.4%),通常在 3–5 次迭代内收敛,并生成可跨模型族迁移的规则。例如,单个错误分类的公司相关查询触发了规则“组织→人类”,从而修复了 25+ 个测试查询。然而,ERGO 并未在所有任务上占主导:ICL-Diversity 在依赖覆盖范围的任务上以零优化成本胜出,DSPy 在多类别任务上胜出,这证实了范式是互补而非竞争的。

我们的主要贡献:
- • ERGO,一种错误驱动的提示优化方法,通过在整个训练集上迭代反馈生成可解释、可迁移的决策规则(第 3 节 (https://arxiv.org/html/2607.20497#S3))。
- • 案例研究展示 ERGO 如何发现其他方法忽略的可学习决策边界:隐藏的约定、渐进边界细化以及跨标签对泛化的结构规则(第 6 节 (https://arxiv.org/html/2607.20497#S6))。
- • 定量分析表明 ERGO 在来自 4 个系列的 5 种模型上具有泛化能力,并且提示可从强模型迁移到弱模型而准确率无明显损失(第 5 节 (https://arxiv.org/html/2607.20497#S5))。
- • 一个实用的范式选择框架:从 ICL-Diversity 开始,对边界可学习任务应用 ERGO,对多类别任务使用 DSPy(第 7 节 (https://arxiv.org/html/2607.20497#S7))。

## 2 提示优化范式  

我们将基于提示的分类方法组织为三种范式:选择示例而不进行迭代优化(Demonstrate)、在准确率信号指导下搜索提示变体(Explore)、以及系统诊断分类错误以优化提示(Diagnose)。

#### 范式 1:Demonstrate(展示)。  
选择多样化的少样本示例作为展示(Brown et al., 2020 (https://arxiv.org/html/2607.20497#bib.bib12));Dong et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib9))。已有研究探索了选择策略(Liu et al., 2022 (https://arxiv.org/html/2607.20497#bib.bib5));Margatina et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib8))、排序效应(Guo et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib24))以及基于多样性的检索(Yu et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib3))。在我们的设置中,ICL-Diversity 通过 k-means 在 Sentence-BERT(Reimers and Gurevych, 2019 (https://arxiv.org/html/2607.20497#bib.bib4))嵌入上选择 k=20 个示例(Su et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib41));ICL-Uniform 随机采样(Brown et al., 2020 (https://arxiv.org/html/2607.20497#bib.bib12))。两者都不涉及迭代优化或适应分类错误。

#### 范式 2:Explore(探索)。  
此范式中的方法在准确率信号指导下搜索提示变体。APE(Zhou et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib15));Honovich et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib30))通过 LLM 采样生成指令候选。OPRO(Yang et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib17))使用 LLM 驱动的元优化。DSPy/MIPROv2(Khattab et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib32))通过贝叶斯优化探索指令×示例组合,基于 35 项小批量得分选择候选。GEPA(Agrawal et al., 2026 (https://arxiv.org/html/2607.20497#bib.bib34))使用带有逐示例错误反馈的进化搜索来指导指令进化。其他方法包括 PromptWizard(Agarwal et al., 2025 (https://arxiv.org/html/2607.20497#bib.bib16))、自我优化(Madaan et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib18))和基于 RL 的方法(Deng et al., 2022 (https://arxiv.org/html/2607.20497#bib.bib28))。

#### 范式 3:Diagnose(诊断)。  
我们的贡献。虽然 Explore 方法也会迭代并可能使用错误反馈,但它们将提示优化视为搜索问题(生成变体、评估、选择)。ERGO 则使用结构化的诊断→建议→重写元提示:每次迭代,它向 LLM 展示一个批次中的正确和错误预测,要求识别混淆的标签对及其原因,然后一次性联合重写完整的提示(指令+示例+分类指南)。ProTeGi(Pryzant et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib35))也使用 LLM 生成的反馈,但仅优化指令。

#### 为何这很重要?  
同期工作(Zhang et al., 2026 (https://arxiv.org/html/2607.20497#bib.bib40))发现提示优化在 4 个任务上“与抛硬币在统计上无法区分”,这引发了何时优化有价值的问题。我们证实了这一点:DSPy 的优化在 35% 的运行中未能在默认指令上找到改进,并且其候选在 35 项小批量上评估,相对于测试准确率过拟合高达 14 个百分点。错误驱动优化通过将搜索聚焦于实际失败点来解决这一问题:不同于搜索指令变体(DSPy/GEPA)或依赖固定示例(ICL),它直接从结构化的错误诊断中学习任务特定的约定。

参看图注  
图 1:ERGO 概览。输入:种子提示 π₀、训练集 Dₜᵣₐᵢₙ、验证集 Dᵥₐₗ 和迭代预算 T。训练数据被随机打乱为大小为 k 的非重叠批次。循环(步骤 1–4):每次迭代选择下一个批次,用当前提示进行分类,将预测结果划分为错误集 Eₜ 和正确集 Cₜ,然后应用诊断→建议→重写元提示生成更新后的提示 πₜ。步骤 5:对每个候选在 Dᵥₐₗ 上评估;返回验证最佳提示 π* = argmaxₜ A(πₜ)。

## 3 ERGO:错误驱动的提示优化  

### 3.1 问题形式化  

令 X 为输入空间,Y = {y₁, …, yₖ} 为有限标签集。我们将提示 π 定义为一个结构化元组:
π = (τ, D, G) (1)
其中 τ ∈ T 是自然语言指令,D = {(xᵢ, yᵢ)}ⁿᵢ₌₁ 是一组上下文示例,G 是一组决策指南(分类规则、边界条件、常见陷阱)。给定一个冻结的 LLM fθ: X × Π → Y,提示优化问题为:
π* = argmax_{π∈Π} A(π), (2)
A(π) = E_{(x,y)∼P}[1[fθ(x;π)=y]] (3)
由于 A(π) 依赖于完整元组 (τ, D, G) 且各组件相互影响(示例 D 的有效性取决于框架它们的指令 τ),我们联合优化所有三个组件,而非孤立优化。

### 3.2 概述  

我们将错误驱动的优化具体化为错误引导优化(ERGO)(图 1 (https://arxiv.org/html/2607.20497#S2.F1))。与基于探索的搜索不同,ERGO 将分类错误用作结构化反馈:每次迭代,它识别哪些标签对被混淆,并生成“为什么”层面的决策规则来区分它们。训练示例被划分为非重叠批次,确保每个示例在迭代中恰好被看到一次。

### 3.3 算法  

#### 种子提示。  
ERGO 从一个最小指令开始(“将输入归类为以下之一:{标签}”),并附带结构化输出格式,没有示例。该方法的所有增益完全来自迭代优化。

表 1:8 个分类基准的测试准确率(%)(5 个种子的均值)。**粗体**=最佳。没有任何方法在总体上显著优于所有其他方法(配对 t 检验,p > 0.05)。

| 数据集 | ICL-Uni | ICL-Div | APE | DSPy | GEPA | ERGO |
|--------|---------|---------|-----|------|------|------|
| TREC (6 cls) | 87.8 | 89.3 | 86.8 | 84.6 | 85.3 | **90.0** |
| CLINC150 (150 cls) | 93.0 | 93.0 | 92.8 | 93.7 | 93.2 | **94.4** |
| RTE (2 cls) | 91.8 | 91.3 | 92.5 | 92.7 | 93.0 | **93.2** |
| Ethos (2 cls) | 85.6 | 85.4 | 63.4 | 88.4 | 87.0 | **88.1** |
| Yahoo (10 cls) | **73.3** | 72.7 | 72.5 | 73.9 | 72.9 | 71.7 |
| 20Newsgroups (20 cls) | 69.9 | **70.8** | 67.7 | 69.2 | 68.7 | 66.8 |
| Rotten Tom. (2 cls) | 93.2 | 93.2 | 92.6 | 92.9 | 93.7 | **92.8** |
| MASSIVE (60 cls) | **90.1** | 89.2 | 89.3 | 90.0 | 89.4 | 87.8 |
| 平均 (8) | 85.6 | 85.6 | 82.2 | 85.7 | 85.4 | 85.6 |

#### 反馈优先的元提示。  
每次迭代,元提示向 LLM 提供:(a) 批次中所有正确分类的示例,(b) 所有错误分类的示例及其预测和真实标签,并指示 LLM:(1) **诊断**哪些标签对被混淆及原因,(2) **建议**具体的决策规则,(3) **重写**完整提示(完整模板见附录 H (https://arxiv.org/html/2607.20497#A8);伪代码见算法 1 (https://arxiv.org/html/2607.20497#alg1))。一个关键副产品是可解释性:生成的提示包含人类可读的决策规则,实践者可以审计、优化或将其用作标注指南。

#### 随机非重叠批次。  
训练示例被洗牌一次;顺序的 20 项批次确保每个示例在迭代中恰好被看到一次,在无需分层复杂度的情况下最大化信息覆盖率。

#### 最佳 T 次选择。  
由于 LLM 生成具有随机性且并不保证每一步都有改进,ERGO 保留所有候选提示并返回验证准确率最高的一个。每个候选在完整验证集上评估以减少选择噪声。实证上,最佳提示在 3–5 次迭代内即可找到。

## 4 实验  

### 4.1 设置  

#### 数据集。  
我们在 8 个代表性分类基准上进行评估,涵盖 2 到 150 个类别,包括 Ethos(Mollas et al., 2022 (https://arxiv.org/html/2607.20497#bib.bib1))、RTE(Wang et al., 2018 (https://arxiv.org/html/2607.20497#bib.bib2))和 CLINC150 等(完整细节见附录 A (https://arxiv.org/html/2607.20497#A1))。每个基准使用分层划分,目标为 200 个训练样本、100 个验证样本和 500 个测试样本,对于较小数据集按比例缩减。

#### 模型。  
通过 AWS Bedrock 使用 Claude Sonnet 4.5(温度=0.0)。每次运行,ERGO 平均耗时 16.4 分钟,而 DSPy 为 28.8 分钟,GEPA 为 30.9 分钟;完整成本比较见表 14 (https://arxiv.org/html/2607.20497#A6.T14)。

#### 种子。  
所有实验使用 5 个随机种子(42, 123, 7, 1, 2)。统计显著性通过配对 t 检验在 5% 水平下进行,涵盖所有 40 个配置(8 个数据集 × 5 个种子)。

#### 基线。  
(1) ICL-Uniform:20 个随机示例;(2) ICL-Diversity:通过 Sentence-BERT(Reimers and Gurevych, 2019 (https://arxiv.org/html/2607.20497#bib.bib4))上的 k-means 选择 20 个示例;(3) APE (Zhou et al., 2023 (https://arxiv.org/html/2607.20497#bib.bib15));(4) DSPy (Khattab et al., 2024 (https://arxiv.org/html/2607.20497#bib.bib32));(5) GEPA (Agrawal et al., 2026 (https://arxiv.org/html/2607.20497#bib.bib34))。所有基线使用相同的种子提示。

相似文章

当标签稀缺时优化如何发挥作用 [R]

Reddit r/MachineLearning

Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。

对比反思用于迭代提示优化

arXiv cs.AI

提出了一种对比反思(Contrastive Reflection)迭代提示优化框架,用于智能体信息检索工作流。该框架利用结构化轨迹识别错误锚定的行为切片,并通过教师LLM进行对比修复,在HotpotQA上实现了显著改进。