局部编辑,全局涟漪:基于回放的工作流合成策略适应
摘要
本文介绍了RIPPLE,这是一种用于工作流合成中持久化提示策略编辑的方法,它解决了编辑局部性和组合敏感性问题,在合成基准测试上将验证成功率提高了高达23.1%。
查看缓存全文
缓存时间: 2026/09/14 08:28
# 本地编辑,全局涟漪:面向工作流合成的重放感知策略适配
来源:https://arxiv.org/html/2609.12127
毛满晴,王泓,山姆松·科尔,袁洁,王卓尔,詹姆斯·冯,
所属机构:林彦君,丹尼尔·埃德米斯顿,妮基·李晶·邝,盛哲诚,牛伟
所属机构:亚马逊公司,\{manqingm, niuwei\}@amazon.com
#### 摘要
提示词策略编辑提供了一种实用的方法来改进能够合成可执行工作流的智能体,而无需更新底层模型。然而,持续的提示词编辑具有两个耦合的特性。首先,**编辑局部性并不意味着影响局部性**:仅限于一个预定义策略段落的编辑可能会在下游执行中产生涟漪效应,改变远超编辑段落的行为。其次,**编辑效果具有组合敏感性**:单独有效果的编辑在组合后可能会相互干扰,导致其中一个或两个编辑失效甚至产生有害效果。因此,持续的适配必须支持两个不同的决策:识别策略**何处**应根据执行反馈进行更改,以及确定生成的编辑在组合后**是否**仍然可以安全地保留。为解决这些挑战,我们引入了 **RIPPLE**(基于重放的持续策略本地化与编辑)。它通过将编辑的位置与组合后的安全性判断分开来应对上述两个特性。RIPPLE 诊断失败的轨迹,将每个可操作的故障映射到预定义的策略段落,并将修正限制在该策略部分。随后,RIPPLE 根据相同的迭代起始策略评估候选编辑,以比较其独立收益,然后在先前已接受的更新之后重放有潜力的编辑,以暴露下游效果和交互作用。只有在组合下仍然安全的编辑才会被保留。我们在 **Flow-HO** 上对 RIPPLE 进行了评估,这是一个用于可执行工作流合成的合成留出基准。RIPPLE 将验证成功率提高了最高 23.1%,并在另外两个冻结的语言模型骨干上产生了正收益,同时保持了较高的编辑效率和较低的执行成本。有针对性的交互分析进一步展示了这两个特性:一个段落局部的工具使用编辑改变了下游的资源解析和验证,而一个单独有益的编辑在组合后变得有害。
## 1 引言
大语言模型智能体越来越多地被要求生成可执行的工件,例如工作流 JSON、基础设施配置和服务集成的自动化。与自由形式的响应不同,这些工件必须满足执行契约:它们必须符合模式、实现请求的行为、解析特定环境的资源,并通过外部验证。因此,一个工作流在语义上可能看似合理,但可能因为一个字段无效、一个转换中断、一个标识符过时或一个修复不完整而无法部署。对于使用冻结模型的智能体,持续的改进可以针对智能体的*提示词策略*:即管理需求解释、规划、工具使用、编辑、验证和修复的指令。这些编辑可以在不改变权重的情况下被审查或回滚。然而,提示词编辑具有两个耦合的特性:首先,**编辑局部性并不意味着影响局部性**:一个局部的指令更改可能在执行中产生涟漪效应,重定向工具调用,改变资源解析和工作流结构,并改变验证或修复行为(Cohen et al., 2024;Sclar et al., 2024)。其次,**编辑在组合下可能产生交互作用**:单独有益的编辑在组合后可能会相互干扰,削弱甚至逆转彼此的收益。因此,提示词适配是一个顺序的策略组合问题,而不是一次性的选择:独立的收益不足以作为持续保留的充分证据。现有方法为提出和选择提示词更新提供了有用的机制。提示词优化器在候选指令中进行搜索(Zhou et al., 2023;Yang et al., 2024a;Guo et al., 2024;Agrawal et al., 2025;Yuksekgonul et al., 2024),而近期的提示词和技能演化系统则使用留出证据来决定哪些更新应该被保留(Yang et al., 2026;Ma et al., 2026;Moll et al., 2026;Shawn, 2026)。然而,这些机制并未共同解决可执行智能体面临的两个挑战。首先,**执行证据必须被定位为一个编辑**。低奖励或验证失败可以识别不成功的执行,但无法定位责任行为或指令。澄清、工具使用、模式构建、编辑局部性和工件完整性方面的失败涉及不同的提示词段落。其次,**编辑必须在其将被保留的策略状态下进行评估**。一个能改善基础策略的编辑,在先前的更新组合后可能变得冗余或有害。*因此,相关的标准不是编辑单独是否有效,而是其在与不断演进的共享策略组合后是否仍然有用且安全。* 我们引入 **RIPPLE**(基于重放的持续策略本地化与编辑)来解决这个问题。这个名称反映了上述两个特性:局部的策略编辑可能在智能体的执行流中产生涟漪,而随着策略的演进,这种涟漪的方向可能会改变。RIPPLE 将适配分解为三个决策。对于*什么失败了*,它使用确定性的分类法分配基于轨迹的标签。对于*在哪里编辑*,它将每个可操作的诊断映射到预定义的提示词段落,并从版本化的库中实例化一个有界补丁,从而约束策略变更的发生点。对于*是否保留*,它按局部收益对候选编辑进行排序,并按顺序提升它们,测试每个局部更改在组合后是否仍然安全。每次接受后,RIPPLE 在所有先前接受的编辑之上来评估下一个候选编辑,因此下游交互会在候选编辑实际会被保留的策略状态下得到评估。模型、工具和执行环境保持固定,而接受的补丁形成可审计、可回滚的检查点。我们在 **Flow-HO** 上评估了 RIPPLE,这是一个用于生成以 JSON 表示的可执行工作流的合成留出套件。RIPPLE 在多个冻结语言模型上持续提高验证成功率和组合奖励,同时保持高编辑效率和低执行成本。消融研究表明,重放设计和补丁组合实质性地塑造了最终策略,而有针对性的交互分析揭示了局部收益在组合后可能逆转。总之,这些结果支持了问题的两个方面:局部编辑可能产生非局部的效果,并且它们的价值取决于不断演进的策略上下文。总而言之,我们的贡献如下:1. **1. 故障本地化的策略编辑**。我们提出了在分段提示词策略上针对冻结智能体的适配方法,将从预定义故障分类法中得出的基于轨迹的诊断映射到目标策略段落和有界修正编辑。2. **2. 组合感知的持久化**。我们引入了一种重放门控的提升程序,通过在先前接受的编辑所形成的推进策略下,针对独立的奖励和正确性约束评估每个候选编辑,将局部效用与组合安全性分离开来。3. **3. Flow-HO 评估与交互分析**。我们构建了 Flow-HO,并在有效性、重放设计、组合安全性和提升规则权衡方面评估了 RIPPLE,显示出显著的留出收益,并揭示了仅通过补丁交互才会出现的故障模式。
## 2 持续的提示词策略适配
### 2.1 问题设置
##### 冻结的可执行智能体策略。我们研究使用冻结的、使用工具的大语言模型智能体进行封闭模式可执行工作流合成。每个任务 $x$ 包含一个自然语言请求 $q$ 和一个初始工作流 $y_0$,其中对于生成任务 $y_0 = \varnothing$:
$$
x = (q, y_0), \qquad \tau \sim p_{\theta}(\tau \mid x, \pi), \qquad \theta \text{ 固定。}
\tag{1}
$$
提示词策略 $\pi$ 管理智能体与工具和外部验证器的多轮交互。只有 $\pi$ 被适配;模型参数、工具接口和执行环境保持固定。一个完成的轨迹 $\tau$ 会获得一个有界的组合奖励:
$$
R(\tau; x) = \rho\!\left( S(\tau), C(\tau), E(\tau), K(\tau) \right),
\tag{2}
$$
其中 $S$ 表示验证成功,$C$ 是工作流正确性,$E$ 是编辑效率,$K$ 是归一化的执行成本。具体的任务特定定义在附录 B.3.4 中给出。因为工作流正确性在提升过程中也受到单独约束,我们同时保留 $R$ 和 $C$ 作为策略级别的度量。对于 $X \in \{R, C\}$,定义任务 $x$ 上的期望度量为:
$$
v_{X}(\pi; x) = \mathbb{E}_{\tau \sim p_{\theta}(\cdot \mid x, \pi)}\left[ X(\tau; x) \right].
\tag{3}
$$
给定任务池 $\mathcal{D}$ 和聚合规则 $g$,策略 $\pi$ 在度量 $X$ 上的池级分数为:
$$
V_{X}^{g}(\pi; \mathcal{D}) = g\!\left( \big( v_{X}(\pi; x) \big)_{x \in \mathcal{D}} \right).
\tag{4}
$$
第 3.3 节将 $g$ 实例化为工作流族上的均匀平均或宏平均。
##### 有序的段落级更新。提示词策略被划分为一组固定的行为段落 $\mathcal{S}$。令 $\mathcal{F}$ 表示故障分类法,$\mathcal{L}$ 表示有界补丁的版本库,其中每个 $a \in \mathcal{L}$ 由一个故障族 $f(a) \in \mathcal{F}$ 和一个目标段落 $s(a) \in \mathcal{S}$ 进行类型化。一个适配是一个被接受的补丁的有序序列:
$$
P = (a_1, \ldots, a_t), \qquad a_j \in \mathcal{L}, \qquad \pi_P = \pi_0 \oplus P.
\tag{5}
$$
运算符 $\oplus$ 按接受顺序将补丁应用于其指定的段落。顺序很重要,因为一个编辑可能会强化、覆盖或与策略中已存在的指令冲突。对于一个候选补丁 $a$、一个已接受的前缀 $P$、一个度量 $X$ 和一个任务池 $\mathcal{D}$,我们定义前缀条件下的边际效应为:
$$
\Delta_{X}^{g}(a \mid P; \mathcal{D}) = V_{X}^{g}(\pi_0 \oplus P \oplus a; \mathcal{D}) - V_{X}^{g}(\pi_0 \oplus P; \mathcal{D}).
\tag{6}
$$
因此,一个持续编辑的价值既取决于补丁 $a$,也取决于策略前缀 $P$。
##### 持续编辑目标。给定一个训练池 $\mathcal{D}_{\mathrm{train}}$、一个重放池 $\mathcal{D}_{\mathrm{replay}}$ 和一个补丁预算 $H$,理想的适配目标是:
$$
P^{\star} \in \arg\max_{P = (a_1, \ldots, a_t), \, t \leq H} V_{R}(\pi_0 \oplus P; \mathcal{D}_{\mathrm{train}})
\tag{7}
$$
$$
\text{s.t.} \quad \Delta_{R}^{g}(a_j \mid P_{j-1}; \mathcal{D}_{\mathrm{replay}}) > 0, \quad \forall j \in [1, t],
$$
$$
\Delta_{C}^{g}(a_j \mid P_{j-1}; \mathcal{D}_{\mathrm{replay}}) \geq 0, \quad \forall j \in [1, t].
$$
目标 (7) 在训练集上最大化验证成功,同时确保每个候选编辑在提升时不会破坏工作流正确性。约束 $\Delta_C^g \geq 0$ 是一个安全护栏;第 4.3.3 节和第 4.3.5 节分析了当放宽此约束时会发生什么。
### 3.1 RIPPLE:基于重放的持续策略本地化与编辑
RIPPLE 将适配分为三个阶段:故障本地化、候选构建和重放门控提升。算法 1 概括了主循环。在每次迭代 $k$ 中,RIPPLE 在当前策略 $\pi_k$ 上收集一批轨迹(第 1 行),诊断故障(第 2-3 行),构建候选补丁(第 4 行),并通过在 $\pi_k$ 上的重放评估它们(第 5-7 行),然后按顺序提升安全的候选(第 8-11 行)以形成 $\pi_{k+1}$。
**算法 1: RIPPLE 主循环**
1: **输入:** 初始策略 $\pi_0$, 故障分类法 $\mathcal{F}$, 补丁库 $\mathcal{L}$, 训练池 $\mathcal{D}_{\mathrm{train}}$, 重放池 $\mathcal{D}_{\mathrm{replay}}$, 迭代预算 $K$, 补丁预算 $H$
2: **for** $k = 0$ **to** $K-1$ **do**
3: $\mathcal{T}_k \leftarrow \text{SampleTrajectories}(\pi_k, \mathcal{D}_{\mathrm{train}})$ $\triangleright$ 收集轨迹
4: $\mathcal{F}_k \leftarrow \text{Diagnose}(\mathcal{T}_k, \mathcal{F})$ $\triangleright$ 分配故障标签
5: $\mathcal{A}_k \leftarrow \text{BuildCandidates}(\mathcal{F}_k, \mathcal{L})$ $\triangleright$ 生成候选补丁
6: $\mathcal{A}_k^+ \leftarrow \text{ReplayGate}(\mathcal{A}_k, \pi_k, \mathcal{D}_{\mathrm{replay}})$ $\triangleright$ 评估并过滤
7: $\pi_{k+1} \leftarrow \text{Promote}(\mathcal{A}_k^+, \pi_k, H)$ $\triangleright$ 提升安全的编辑
8: **end for**
9: **return** $\pi_K$
#### 3.1.1 故障本地化与候选构建
##### 诊断。RIPPLE 使用一个确定性的分类法 $\mathcal{F}$ 将低奖励轨迹映射到一个可操作的故障族集合。分类法包含六个超族(F1 到 F6),每个族对应于智能体策略中一个不同的干预点。F6 族进一步细分为子族(F6a 到 F6h),以处理诸如缺失块、边缘故障和参数键错误等特定模式。对于一个轨迹 $\tau$,诊断函数 $\text{Diagnose}(\tau, \mathcal{F})$ 根据一系列谓词检查返回一个最小的故障族集合。谓词包括诸如“模式是否有效?”(针对 F3)、“是否缺少必需的块?”(针对 F6a)和“是否所有边缘都有目标?”(针对 F6b)等检查。当存在直接证据时(例如,验证器拒绝某个特定字段),其优先级高于后续检查。
##### 候选构建。对于每个诊断出的故障族 $f$,RIPPLE 从补丁库 $\mathcal{L}$ 中检索所有以 $f$ 为类型并以某个段落 $s$ 为目标的补丁。如果多个补丁适用于同一段落和故障族,则选择在元数据中声明了最细粒度子族的补丁(例如,F6b 优于 F6)。然后,该补丁与诊断上下文(如具体的故障值)一起实例化,从而产生一个具体的候选编辑 $a$。最终,对于一个轨迹批次,我们得到一组候选 $\mathcal{A}_k$,每个候选都与一个故障族、一个目标段落和一个实例化的补丁相关联。
#### 3.1.2 重放门控提升
RIPPLE 使用一个两阶段的过程来决定哪些候选编辑应该被保留:训练侧排序和重放侧提升。
##### 训练侧排序。RIPPLE 首先根据候选编辑 $a$ 在训练池上的局部边际效应 $\Delta_{\mathrm{train}}(a)$ 进行排序。具体来说,它计算 $a$ 在当前策略 $\pi_k$ 上的预期验证成功改进:$\Delta_{\mathrm{train}}(a) = V_R(\pi_k \oplus a; \mathcal{D}_{\mathrm{train}}) - V_R(\pi_k; \mathcal{D}_{\mathrm{train}})$。然后,它选择 $\Delta_{\mathrm{train}}(a) > 0$ 的候选集合 $\mathcal{A}_k^+$,并按 $\Delta_{\mathrm{train}}(a)$ 降序排序。此阶段确定了有潜力的编辑及其评估顺序;重放侧的提升决定它们在组合后是否仍然安全。
##### 重放侧策略提升。在按 $\Delta_{\mathrm{train}}$ 降序对 $\mathcal{A}_k^+$ 排序后,令 $a_j$ 表示此顺序中的第 $j$ 个候选补丁。令 $P_j^0$ 表示在提升 $a_j$ 之前策略中已接受的补丁前缀(即,$\pi_k = \pi_0 \oplus P_j^0$)。对于每个 $a_j$,RIPPLE 构建一个提升的策略 $\pi_k' = \pi_k \oplus a_j$,并在重放池 $\mathcal{D}_{\mathrm{replay}}$ 上评估它。它检查两个条件:(1) 验证成功是否提升($\Delta_R^g(\pi_k'; \mathcal{D}_{\mathrm{replay}}) > 0$),以及 (2) 工作流正确性是否未下降($\Delta_C^g(\pi_k'; \mathcal{D}_{\mathrm{replay}}) \geq 0$)。如果两个条件都满足,则补丁 $a_j$ 被接受,并应用于当前策略以形成 $\pi_{k+1}$。如果任一条件失败,则补丁 $a_j$ 被拒绝。重要的是,提升是顺序进行的:每个候选的评估都是在先前接受的编辑已应用到策略之上进行的,因此下游交互作用在它们实际发生的策略状态下得到测试。RIPPLE 持续此过程,直到接受 $H$ 个补丁或没有更多候选被接受。
### 3.3 评估设置与协议
我们在 **Flow-HO** 上评估 RIPPLE,这是一个合成留出基准,包含 1,200 个任务,这些任务被划分为 12 个工作流族(每族 100 个任务)。每个任务要求生成一个符合给定 JSON 模式的工作流。我们使用三个冻结的语言模型骨干:GPT-4o-mini、Claude-3.5-Haiku 和 Llama-3.1-8B-Instruct(通过 API 访问)。我们将训练集和测试集按 80/20 的比例划分(960/240 个任务)。对于 RIPPLE,我们使用一个大小为 200 的固定重放池(从训练集均匀采样),并设置最大迭代次数 $K=10$ 和补丁预算 $H=5$。我们报告两个主要指标:(1)**验证成功率 (VS)**:在测试集上通过外部验证器的任务比例。(2)**组合奖励 (CR)**:测试集上 $R(\tau; x)$ 的平均值。我们还将编辑效率定义为每个接受的编辑所带来的平均验证成功率提升。
### 4.3 消融与案例研究
#### 4.3.1 重放设计的影响
RIPPLE 的重放门控机制对于确保组合安全至关重要。我们通过比较三种变体来研究其影响:(1) **RIPPLE**(完整模型),(2) **No-Replay**:跳过重放评估,直接在训练收益的基础上按顺序接受所有正向编辑,以及 (3) **Single-Replay**:在初始策略 $\pi_0$ 上评估所有候选,而不是在推进的策略上。表 3 显示了结果。**No-Replay** 变体在所有骨干上的验证成功率和组合奖励均低于 RIPPLE,这证实了编辑可能在组合后相互干扰。**Single-Replay** 变体性能接近 RIPPLE,但略低,这表明在推进策略上进行评估可以更准确地捕捉下游交互作用。这些结果强调了 RIPPLE 的顺序、重放感知设计的重要性。
#### 4.3.2 组合安全性的证据
为了直接演示组合交互作用,我们分析了一个来自 GPT-4o-mini 运行的特定案例。在一次迭代中,RIPPLE 诊断出两个故障:F2(工具使用错误)和 F6a(缺失块)。它构建了两个候选补丁:补丁 A(针对 F2,修改工具调用指令)和补丁 B(针对 F6a,在模式构建段落中添加一个必需字段)。在单独评估时,补丁 A 将验证成功率提高了 +5.2%,补丁 B 提高了 +3.1%。然而,当按顺序应用(先 A 后 B)时,组合验证成功率仅提高了 +1.8%,低于单独收益之和(+8.3%)。进一步检查表明,补丁 A 更改了解析工具输出的方式,这意外地使补丁 B 中添加的字段解析变得复杂,导致部分验证失败。RIPPLE 的重放评估正确地捕捉到了这种干扰,并在提升补丁 B 时拒绝了它,因为其在策略 $\pi_0 \oplus A$ 上的组合验证成功增量不满足提升阈值。这个案例研究明确地说明了局部编辑如何产生非局部影响,以及 RIPPLE 如何通过组合感知提升来确保安全。
#### 4.3.3 与技能演化方法的比较
我们将 RIPPLE 与两种最近的提示词/技能演化方法进行了比较:**SkillGen**(Ma et al., 2026)和 **OPRO**(Yang et al., 2026)。为了公平比较,我们实现了这两个系统的受控版本,使用相同的训练/测试划分、模型骨干和重放池大小,但保留了它们各自的提升规则。**SkillGen** 使用一种基于经验规则的接受准则:当在重放池上观察到的验证成功改进的四舍五入值至少为 2 或池大小的 5%(取较大值)时,接受一个更新。**OPRO** 使用一个基于优化的方法,在重放池上学习一个预测更新效用的代理模型,并接受预测效用为正的更新。表 4 显示了结果。RIPPLE 在所有骨干上的验证成功率均优于 SkillGen 和 OPRO。SkillGen 的表现第二,但其固定的提升规则可能过于保守或过于宽松,具体取决于上下文。OPRO 的表现更差,这可能是因为其代理模型未能准确捕捉复杂的组合交互作用。值得注意的是,RIPPLE 与 SkillGen 之间的差距在 Llama-3.1-8B-Instruct 上最为显著,这表明 RIPPLE 的确定性本地化和组合感知提升在较小的模型上尤其有价值。相似文章
Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing
This paper introduces HPSE, a hybrid-policy self-editing method for composable unstructured knowledge editing in LLMs, enabling edited models to answer atomic questions and perform multi-hop reasoning about injected knowledge. The approach uses proactive self-distillation with hybrid rollouts and is validated across multiple LLM backbones and editors.
Warp RL: 重塑基础策略分布以适应动力学变化
Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。
通过结构感知策略学习内化学术写作工作流以生成引言
本文提出StructPO,一种结构感知的策略学习框架,通过显式阶段标记和精炼引导优化,将多阶段学术写作工作流内化到单次LLM策略中,从而提高引言生成质量和效率。
SERPO:面向开放式测试时强化学习的自演化评分策略优化
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
面向LLM安全性的在线策略蒸馏:一种基于路由的模板鲁棒对齐方法
本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。