反例作为代理自我纠正的反馈
摘要
本文介绍A-CEGIS,一个使用反例反馈来评估和改进自然语言到正则表达式合成中多轮代理自我纠正的框架,实现了高成功率。
arXiv:2609.02892v1 Announce Type: new
摘要:单轮代码生成指标低估了已部署代理的一个核心特性:它们在接收具体反馈后能否修复错误工件。本文提出A-CEGIS,一个轻量级框架,使用反例作为反馈来评估自然语言到正则表达式合成中的多轮优化。代理提出一个正则表达式,一个确定性预言机在全匹配语义下检查它,紧凑的假阳性或假阴性见证指导下一轮。在30个NL-RX-Turk任务上,诊断性反例反馈在四轮消融预算内解决了90%的任务,而零样本生成为17%,通用自我纠正为27%,仅错误反馈为23%。在完整的诊断运行中,通过强化,所有任务在最后一轮都在隐藏集上解决,平均成功时间为2.7轮,针对性探测后稳健成功率为77%。这些结果表明,A-CEGIS衡量代理跨轮改进的效率,同时在原始保留案例之外增加了实际的稳健性检查。
查看缓存全文
缓存时间: 2026/09/04 05:50
# 反例作为智能体自我修正的反馈
来源:https://arxiv.org/html/2609.02892
###### 摘要
单轮代码生成指标低估了已部署智能体的一个核心属性:它们在收到具体反馈后能否修复错误的产物。本文提出了A-CEGIS,一个轻量级框架,该框架利用反例作为反馈来评估自然语言到正则表达式合成中的多轮精修。智能体提出一个正则表达式,确定性预言机在完全匹配语义下检查该表达式,紧凑的假阳性或假阴性反例为下一轮提供引导。在30个NL-RX-Turk任务上,诊断性反例反馈在四轮消融预算内解决了90%的任务,而零样本生成解决17%,通用自我修正解决27%,仅错误反馈解决23%。在包含强化的完整诊断运行中,所有任务在隐藏集上最终轮次均被解决,平均成功时间为2.7轮,经针对性探测后稳健成功率为77%。这些结果表明,A-CEGIS能衡量智能体跨轮次改进的效率,并在原始保留用例之外增加了实用的鲁棒性检查。
###### 关键词:
多轮智能体、智能体评估、正则表达式合成、LLM自我修正、LLM基准测试
## 1 引言
软件智能体很少仅在第一次尝试时就有用:它们必须利用反馈,修复错误的产物,并避免破坏已正确的行为。标准的单次评估指标(如pass@1)仍然有用,但它们无法衡量修复效率、跨修订的稳定性,或者一个看似已解决的任务在更严苛测试下是否保持稳健。
我们在自然语言到正则表达式的合成问题上研究这个问题,因为这种产物紧凑、脆弱且可执行。一个小型运算符的改变就可能改变所接受的语言,而正确性可以通过确定性地检查正反字符串来验证。这使得正则表达式合成成为隔离精修行为的一个受控场景,避免与检索、界面使用或其他智能体-环境效应混杂。
本文介绍了A-CEGIS,一个用于衡量智能体自我修正的反例反馈循环。智能体提出一个正则表达式,预言机使用`re.fullmatch`语义对其进行评估,下一轮提示会收到具体的假阳性和假阴性反例,而非笼统的批评。在30个NL-RX-Turk任务上,诊断性A-CEGIS在四轮消融预算内达到0.900的隐藏集成功率,而零样本生成为0.167,通用自我修正为0.267,仅错误反馈为0.233。在更长的诊断预算和针对性强化下,隐藏集成功率达到1.0,稳健成功率为0.767。本文的贡献包括一个可复现的CEGIS风格循环、衡量收敛与回退的轨迹指标、直接的反馈策略消融实验,以及一个能揭示端点准确性所隐藏的失败的鲁棒性探测。
## 2 背景与相关工作
LLM评估历来强调首次尝试的质量、精确匹配和单步任务完成度。代码生成基准如HumanEval和MBPP将功能正确性作为合成的核心度量[8, 9],而SWE-bench将评估推向了真实的软件修复[12]。近期工作指出,多轮智能体同样需要衡量上下文保持、交互质量和错误恢复的能力[1];编码基准也显示性能在多轮设置中可能下降[2]。这些结果推动了对过程级评估(而不仅仅是端点评分)的需求。
自我精修方法表明,模型可以通过重复反馈和修订来改进输出[3, 11],ReAct展示了将推理与环境行动交错的价值[10]。然而,自然语言反馈可能嘈杂或不明确。AgentBoard及相关基准将评估扩展到工具介导的环境[4],但这种环境可能将修复技能与检索、动作选择和界面效应混杂。A-CEGIS提出了一个更窄的补充问题:在给定失败的确定性证据的情况下,智能体能否高效修复一个紧凑的形式化产物?
自然语言到正则表达式的合成很适合这个问题。NL-RX将描述映射到正则表达式[5],而基于示例的编程和CEGIS工作展示了可执行示例和反例引导修订的价值[14, 6, 13]。A-CEGIS将这种交互模式适应于语言智能体评估。它不是一个完整的等价证明,因为验证器使用有限测试和针对性探测,但每一轮都基于可执行语义。这使我们能够衡量需要多少轮次、修复是否局部、修订是否引入回退,以及隐藏集解决方案是否在额外探测下存活。
## 3 方法论
评估框架使用确定性的Python正则表达式评估、合成的任务本地测试和LLM接口。一个任务是$(d_i, g_i)$,其中$d_i$是自然语言描述,$g_i$是金标准Python兼容正则表达式。对于每个任务,预言机构建$T_i = P_i \cup N_i$,在所报告的配置中包含12个生成的正例和12个生成的负例。正例通过轻量级解析器驱动的生成器从金标准正则表达式中采样;负例来自变异和随机采样,仅在被$g_i$拒绝时保留。
### 3.1 预言机构建
金标准正则表达式仅用作可执行规范。正例在可能的情况下通过递归遍历解析的表达式生成,包括字面量、分支、字符类、子模式和有界重复。负例通过对正例种子进行删除、插入、替换、交换、截断和在可打印字母表上随机采样生成,遵循以下直觉:小型编辑操作通常会暴露边界行为[7]。采样的负例只有在全字符串匹配下未能通过金标准正则表达式时才会被保留。
这种构建有两个实际结果。首先,该基准可以在没有外部定理证明器或自动机库的情况下运行。其次,隐藏集是任务本地的:失败往往发生在目标正则表达式的语义材料附近,而非不相关的全局字符串分布中。权衡在于隐藏集成功不等同于语义等价。这个限制是有意为之的,因为它创造了衡量采样成功与针对性探测下鲁棒性之间差异的空间。
任务描述$d_i$ 智能体提议 $r_t$ 预言机检查 $T_i$ 全部通过?假阳性/阴性反例 针对性强化探测 探测干净?稳健解决方案 否 是 是 否
图1:A-CEGIS评估循环,其中候选正则表达式针对隐藏测试进行检查,失败成为诊断性反例,隐藏集成功触发针对性鲁棒性探测。图1展示了核心循环。在第$t$轮,智能体提议 $a_i^{(t)}$。预言机计算通过向量 $\mathbf{y}_i^{(t)}$(覆盖 $m = |T_i|$ 个案例)和通过率 $\rho_i^{(t)} = \frac{1}{m}\sum_{j=1}^m y_{i,j}^{(t)}$。如果 $\rho_i^{(t)} < 1$,则根据策略生成反馈。在诊断性A-CEGIS策略中,反馈包含最多两个假阴性和两个假阳性,并按有利于紧凑反例排序。这不仅告诉模型正则表达式是错误的,还告知语言应该被放宽还是收紧。
实现支持一个小的策略网格:零样本生成、使用通用语言反馈的自我修正、无反例的仅错误反馈、包含一个失败示例的最小A-CEGIS、包含三个示例的A-CEGIS,以及诊断性A-CEGIS。下面报告的消融实验在相同任务集上比较了零样本、通用自我修正、仅错误反馈和诊断性A-CEGIS。通用循环在所有策略中相同;只有失败轮次后返回的信息不同。
在隐藏集成功后,强化阶段搜索一个针对性探测池 $Q_i(r)$,寻找金标准 $g_i$ 和候选 $r$ 不一致的反例。该池由短的通用字符串、任务描述中的词元、从金标准和候选正则表达式中提取的字面量、现有的正反例以及简单的变换(如前缀、后缀、重复、连接和字符变异)构建。这使得探测分布有意是局部的:它强调任务已隐含的语言附近的边界,而非采样任意字符串。
### 3.2 强化协议
强化旨在暴露原始隐藏集未采样到的语义错误。对于候选 $r$,探测阶段搜索字符串 $w \in Q_i(r)$,使得 $\mathbb{1}[g_i(w)] \neq \mathbb{1}[r(w)]$。每个不匹配都被标记方向。如果金标准正则表达式接受 $w$ 但候选拒绝它,则 $w$ 成为探测导出的假阴性;如果候选接受 $w$ 但金标准拒绝它,则 $w$ 成为探测导出的假阳性。在所报告的配置中,每个强化周期评估多达320个探测,向任务本地测试集添加最多四个探测导出的反例,并给智能体一次修复尝试。此过程最多重复两个周期,产生扩展集 $T_i' = T_i \cup C_i$。
最终状态比基础成功更严格。*隐藏成功*意味着候选通过原始采样的正反例。*强化成功*意味着修复后的候选在添加探测导出的示例后通过了扩展集。*稳健成功*额外要求最终探测通过且无剩余不匹配。因此,一个正则表达式可能在隐藏集上看起来已解决,但仍然可能失败于鲁棒性,因为它接受装饰性字面量、遗漏最小长度情况或使用过于宽泛的字符类。
该基准记录端点和过程指标。如果 $\tau_i$ 是第一次成功的轮次,它报告Pass@1、Pass@最终、平均成功时间和MRR。修复局部性通过连续正则表达式词元序列之间的归一化编辑相似性来衡量,$S_i^{(t)} = 1 - \frac{\mathrm{EditDist}(u^{(t-1)}, u^{(t)})}{\max\{|u^{(t-1)}|, |u^{(t)}|, 1\}}$,而净修复行为通过精修效率比 $\mathrm{RER} = \frac{\sum_{i,t} f_i^{(t)}}{\max(1, \sum_{i,t} b_i^{(t)})}$ 来衡量,其中 $f$ 计数修复的案例,$b$ 计数回退的案例。
这些指标旨在描述精修轨迹而非仅仅是其端点。平均成功时间和MRR衡量智能体收敛的速度。稳定性区分局部修复与完全重新生成。RER询问循环修复的行为是否多于破坏的行为,这对于形式化产物尤其重要:一个解决某个反例但回退几个早期案例的修订,即使在自然语言中看起来合理,也不是良好的修复。
## 4 实验与结果
实验产物在30个NL-RX-Turk任务上评估Gemini 3 Flash Preview。每个任务在强化前使用24个隐藏预言机检查。我们报告两个互补的设置。首先,四轮反馈策略消融比较了零样本生成、通用自我修正、仅错误反馈和诊断性A-CEGIS(无强化)。其次,完整诊断运行允许最多七轮,随后是最多两个强化周期,每个周期有一次修复尝试。
运行有意聚焦于反馈机制而非模型排名。它并不声称比较模型家族。相反,它测试一个有能力的模型,在给定结构化反例的情况下,是否表现出A-CEGIS旨在衡量的修复动态,以及这些动态是否与较弱的反馈通道不同。因为正则表达式评估是确定性的,通过率、稳定性和鲁棒性的变化可归因于候选序列,而非随机的环境效应。
表1:30个任务的完整诊断A-CEGIS结果
| 指标 | 值 |
| :--- | :--- |
| 任务数 | 30 |
| Pass@1 | 0.167 |
| Pass@最终(隐藏集) | 1.000 |
| 平均成功轮次 | 2.667 |
| 平均倒数排名 | 0.477 |
| 平均初始通过率 | 0.706 |
| 平均最终通过率 | 1.000 |
| 平均结构稳定性 | 0.561 |
| 修复事件数 | 311 |
| 回退事件数 | 99 |
| 精修效率比 | 2.613 |
| 强化后Pass@最终 | 0.767 |
| 探测干净率 | 0.767 |
| 稳健Pass@最终 | 0.767 |
| 平均强化最终通过率 | 0.937 |
| 添加的探测导出反例 | 80 |
| 完成的强化周期 | 40 |
表1显示首轮与最终隐藏集成功率之间存在巨大差距。只有30个任务中的5个立即解决,但所有任务都通过完整诊断循环解决。平均初始通过率为0.706,表明初始正则表达式通常接近但不完整;修复轨迹将这些部分匹配转化为隐藏集完美的解决方案。RER为2.61,修复311次,回退99次,因此精修是净建设性的而非振荡性的。
MRR为0.477表明收益并非仅仅是多轮尝试后的最后一轮救援。大多数任务在几轮内收敛,但不在第一轮。这正是多轮评估具有信息量的场景:单次准确性对最终的修复能力过于悲观,而仅最终成功则隐藏了收敛的成本和路径。
表2:30个任务在四轮预算下的反馈策略消融
表2隔离了反馈内容的效果。所有策略使用相同的模型和任务集,诊断行在与基线相同的四轮预算下评估。返回具体的假阳性和假阴性反例,比要求模型通用地自我修正或仅报告隐藏测试失败数量有效得多。诊断性A-CEGIS在四轮内解决了30个任务中的27个,而通用自我修正为8个,仅错误反馈为7个,零样本生成为5个。它也使用不超过较弱多轮基线的平均生成尝试次数,表明改进来自更具信息性的反馈,而不仅仅是更多轮次。
表3:首次成功轮次的分布
表3显示大多数任务需要明确的修复:30个任务中有25个在第一轮后解决,众数为第二轮。没有任务需要超过六轮。强化结果随后将隐藏集成功与鲁棒性分离。只有30个任务中的23个保持探测干净;其他七个通过了原始采样测试,但在涉及边界、重复或宽泛字符类的针对性变体上失败。
轮次分布相似文章
CoCoGEC:用于鲁棒语法错误纠正的反事实生成
提出CoCoGEC,一种反事实生成框架,通过改变GEC训练数据中与错误无关的上下文来提升模型鲁棒性,在扰动基准上取得了显著的F0.5提升。
EVE-Agent: 可验证证据的自我进化智能体
EVE-Agent 提出了一个自我进化搜索智能体框架,通过生成问题、答案和证据片段,并基于证据的边际准确性增益进行训练,确保证据可验证性。这提高了基于依据的正确性,且无需人工标注。
CAFE:自我改进的搜索智能体需要协同进化的反馈
CAFE是一个通过共享参数将搜索智能体和评价器耦合起来的框架,以学习轨迹内的纠正反馈,从而提升搜索性能并减少在各基准测试中的幻觉现象。
来自元认知反馈循环的观察——我的AI代理自主运行一小时
本文描述了在元认知反馈循环下运行的AI代理的观察结果,详细阐述了诸如带有终止刹车的自纠正和检测自身校准偏差等行为。
是什么驱动了反馈带来的交互式改进?
本文研究了在多轮语言智能体场景中,自然语言反馈带来的改进是否超越了仅靠反复尝试所取得的提升。通过跨多个基准测试的受控学生-教师协议,作者发现自我生成的反馈几乎没有额外增益,而强大的外部教师则能带来显著更大的提升,并且学生根据反馈采取行动的能力是关键瓶颈。