通过自适应校正调度在生成采样中强制执行约束

arXiv cs.LG 论文

摘要

本研究论文提出了一种用于在生成采样中强制执行硬约束的自适应校正调度方法,证明与末端或逐步投影方法相比,该方法能够改善成本-精度边界。

arXiv:2605.11214v1 公告类型:新文章 摘要:在生成采样中,硬约束通常通过投影来强制执行,投影要么在采样结束时应用一次,要么在每次更新后应用。这种二元框架忽视了一个基本问题:投影会改变状态分布,而未来的更新依赖于该分布。因此,延迟投影产生的样本可能在最终投影后虽可行,但与预期的采样动态不一致。我们将约束强制执行形式化为生成展开过程中的校正调度问题。使用单步约束缺陷作为几何失配的局部信号,我们引入了自适应校正调度,这是一种状态依赖策略,将投影预算分配给对轨迹扰动最强的步骤。末端投影和逐步投影是该策略族的极限情况。在受控流形展开和学习的投影扩散采样器中,自适应调度在匹配的投影预算下改善了成本-精度边界,以75%更少的校正恢复了71.2%的完全逐步投影收益。这些结果表明,在生成采样中,约束时序是一个核心设计变量,仅强制执行可行性不足以保留预期的约束采样动态。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:35

# 通过自适应校正调度在生成采样中强制约束

来源:https://arxiv.org/html/2605.11214
Noah Trupin, Yexiang Xue
普渡大学计算机科学系
{ntrupin,yexiang}@purdue.edu

###### 摘要

在生成采样中,硬约束通常通过投影来强制执行,这种投影要么仅在采样结束时应用,要么在每次更新后应用。这种二元框架忽视了一个根本问题:**投影会改变状态分布,而未来的更新依赖于这些状态。** 因此,延迟投影可能会产生虽然可行但与预期采样动态不一致的样本,即使经过了最终投影。我们将约束强制执行形式化为生成展开(rollout)上的校正调度问题。利用单步约束缺陷作为几何失配度的局部信号,我们引入了**自适应校正调度**,这是一种状态依赖的策略,将投影预算分配给那些对轨迹扰动最大的步骤。终端校正和逐步校正作为该策略族的极限情况出现。在受控流形展开和学习的投影扩散采样器中,自适应调度在匹配投影预算的情况下改善了成本-准确性前沿,以75%更少的校正次数恢复了71.2%的完整逐步收益。这些结果表明,约束时机是生成采样中的一级设计变量,且仅强制可行性不足以保留预期的约束采样动态。

<!-- Refer to caption -->
图1:**自适应校正以极低的成本保留展开过程。** 终端校正仅在轨迹已经偏离崎岖地形后才进行投影,产生可行但动态不一致的路径。逐步校正通过在每次更新后投影来防止漂移,但需承担全部投影成本。我们的自适应调度器使用相同的投影算子,但仅花费25%的投影调用次数,将其集中在缺陷最大的地方,以紧密跟踪逐步展开过程。

## 1 引言

生成模型越来越多地部署在输出必须满足硬约束的场景中,包括轨迹合成、机器人规划和结构化生成(Li et al., 2024; Lian et al., 2025; Zhang et al., 2025; Christopher et al., 2024; Cardei et al., 2025b; Santin et al., 2025)。在这些领域中,样本需要位于由几何、物理或特定任务结构定义的流形上。一种常见的策略是在环境空间中运行生成过程,并通过投影来强制可行性。这提出了一个问题:**何时应用投影?**

在实践中,两种策略占主导地位:终端校正仅在采样结束时投影,而逐步校正则在每次更新后投影。这两种方法都被广泛使用,且都能产生可行的输出。然而,它们将校正时机视为固定的设计选择,而不是算法的一部分。这种框架忽视了生成更新是状态依赖的,因为每一步都是基于当前迭代值计算的。一旦展开过程离开约束集,后续更新就会在约束轨迹永远不会访问的状态上评估。后来的投影可以恢复可行性,但通常无法撤销由这些流形外状态引起的分布偏移。因此,经过终端校正的样本往往是可行的但不正确。它们位于约束集上,但对应于在展开过程中偏离约束动态的轨迹。

因此,约束强制执行不仅关乎在端点满足可行性,还关乎保留产生该端点的轨迹分布。这使得校正时机成为一个资源分配问题。在典型的展开过程中,大多数更新仍接近约束集,而较小的一部分产生大幅度的偏离,从而驱动下游误差。终端校正对这些关键步骤的努力分配不足,而逐步校正则在所有地方过度分配努力。因此,核心挑战是如何在整个展开过程中分配有限数量的校正。

我们通过将约束强制执行重新框架化为校正调度问题来解决这一问题。我们使用单步约束缺陷(即提议的更新与可行集之间的距离)作为几何失配的局部信号。小缺陷表明展开过程保持在接近约束轨迹的状态,而大缺陷识别出那些其效应不太可能在后期得到校正的步骤。这导致了一种在线预算策略:在缺陷高的步骤上花费校正资源,在这些地方投影预计能最大程度地减少下游轨迹误差。这产生了一系列在线预算调度,它们在终端校正和逐步校正之间进行插值,同时适应每个展开过程的实现缺陷概况。

从根本上说,该策略并非叠加在现有方法上的启发式方法,而是通过轨迹一致性视角看待约束强制执行的直接结果。它模型无关,不需要通过投影进行梯度计算,除了缺陷评估外引入的开销可忽略不计。我们的贡献是对约束生成采样的调度观点:

1. **时机改变展开过程。** 我们表明,延迟校正会改变未来更新的分布,产生仅靠终端投影无法解决的端点偏差。
2. **约束强制执行是一个预算分配问题。** 我们将校正形式化为在整个展开过程中分配有限数量的投影,使终端、周期性和自适应策略可以直接比较。
3. **缺陷提供了有效的价值代理。** 在线预算调度器利用缺陷,在校正最能显著扰动轨迹的步骤上花费校正资源。
4. **自适应调度改善了成本-准确性前沿。** 在匹配的校正成本下,自适应策略恢复了接近逐步的保真度,同时使用了少得多的投影。

在受控流形展开和学习扩散设置中,我们观察到约束违规在时间上高度异质,且选择性地校正高缺陷步骤始终优于均匀策略。这些结果表明,约束时机是生成采样中的一个基本自由度,且仅强制可行性不足以保留预期的约束分布。

## 2 相关工作

先前的工作通过将投影或优化纳入采样循环来在生成建模中强制执行硬约束(Christopher et al., 2024; Santin et al., 2025; Utkarsh et al., 2025; Zhang et al., 2025; Hoseinpour and Dvorkin, 2025)。在扩散和基于流的模型中,投影采样方法通常在每一步之后应用投影,以在整个生成过程中保持可行性(Chien et al., 2024; Li et al., 2024; Xiao et al., 2024; Janner et al., 2022; Lian et al., 2025; Yang et al., 2026; Santin et al., 2025; Utkarsh et al., 2025; Ni and Qureshi, 2024)。变体方法引入了投影梯度、可微优化层或离散约束算子(Cardei et al., 2025a, b; Chen et al., 2024; Hoseinpour and Dvorkin, 2025)。这些方法解决了如何强制执行约束的问题,但大多将校正时机视为固定的。逐步投影通常作为默认值采用,而终端投影则用作更便宜的替代方案。我们的工作则专注于何时应应用校正,同时保持底层生成过程固定。

这个问题与几何积分密切相关,其中更新规则与投影或缩回之间的相互作用决定了长期行为(Hairer, 2001; Séguin et al., 2024; Christopher et al., 2024; McLachlan et al., 2014; Liñán and Diego, 2023)。经典结果表明,投影和动态通常不交换,即使端点可行也会导致轨迹漂移。我们的设置有两个关键不同之处:动态是学习的且随机的,目标是沿准确性高效分配校正计算。

另一系列工作研究扩散中的自适应调度,选择时间步或噪声水平以权衡速度和样本质量。诸如 AdaDiff、TDPM、步长蒸馏和主动噪声估计等方法在时间上分配去噪计算(Zhang et al., 2024; Ye et al., 2025; Pei et al., 2025; Kim and Kim, 2026)。这些方法沿着正交轴操作:它们控制生成动态本身。相比之下,我们分配约束强制执行,将投影视为用于保持轨迹一致性的有限资源。最接近的方法是交替使用优化和采样的方法,但这些方法均匀地或通过固定启发式方法应用校正。我们将校正视为一个预算分配问题。

## 3 自适应校正调度

投影时机是一个控制决策。我们不是仅在末尾或每次更新后投影,而是将校正视为需要在整个展开过程中分配的有限资源。给定长度为 $T$ 的展开和校正预算 $B$,调度器必须选择哪些提议的更新进行投影。理想策略应在最能减少未来轨迹误差的地方花费校正资源,但在实践中这种边际价值并不直接可观测。我们的方法使用单步约束缺陷作为在线代理。在每一步,调度器首先在不进行校正的情况下应用生成更新,测量提议的状态偏离约束集的程度,然后决定这种偏离是否值得花费一个单位的预算。大缺陷表明展开过程已进入未来更新可能与约束轨迹不同的区域,而小缺陷表明可以安全地延迟投影。因此,自适应调度器在校正最可能导致漂移的地方花费校正资源,同时匹配固定周期性基线的投影预算。本节将这一想法形式化:我们描述带有校正事件的展开,定义缺陷为调度信号,并推导我们的预算感知在线策略。

### 3.1 带有校正事件的展开

<!-- Refer to caption -->
图2:**当轨迹误差在时间上集中时,自适应增益出现。** 每个面板显示了相对于逐步参考的归一化状态误差以及投影事件。在易变地形设置(左)中,少数高缺陷区域主导路径误差;周期性校正均匀花费预算并错过其中几个事件,而自适应校正集中在最能减少下游漂移的地方进行投影。在均匀设置(右)中,缺陷更加分散,因此自适应和周期性之间的差距缩小。这支持了自适应校正在一部分展开步骤控制轨迹误差时帮助最大的观点。

我们考虑一个理想情况下在约束集 $\mathcal{M} \subset \mathcal{X}$ 上演化的生成过程,其中 $\mathcal{X} \subseteq \mathbb{R}^d$ 是环境空间。在许多应用中,$\mathcal{M}$ 是光滑嵌入流形或由硬约束定义的集合,如运动学可行性、几何结构或物理有效性。然而在实践中,生成模型在环境空间中运行。展开过程通过重复应用学习到的更新规则进行:

$$ x_{t+1} = \Phi_h(x_t), \quad t=0,\ldots,T-1, $$

其中 $\Phi_h$ 表示离散更新算子,如反向扩散步骤或流匹配更新,步长为 $h$。

为了强制可行性,我们假设有一个投影或缩回算子 $\Pi: \mathcal{X} \to \mathcal{M}$,它将任意状态映射回约束集。标准目标是产生最终样本 $x_T \in \mathcal{M}$。然而,这种端点观点是不完整的,因为生成过程本质上依赖于轨迹:每次更新都是从当前状态计算的。如果展开过程离开 $\mathcal{M}$,后续更新会在约束轨迹永远不会访问的状态上评估。虽然后来的投影可能恢复可行性,但通常无法撤销已经进行的流形外更新。图2说明了在没有原则性约束强制执行的情况下,采样过程中误差的更大积累。

因此,投影是对动态的干预,应用它会改变计算未来更新的状态以及最终样本。我们通过引入校正调度 $\sigma: \{0,\ldots,T-1\} \to \{0,1\}$ 来形式化这种干预,其中 $\sigma(t)=1$ 表示在步骤 $t$ 后应用投影。给定提议的更新

$$ \tilde{x}_{t+1} = \Phi_h(x_t), \tag{1} $$

校正后的展开定义为

$$
x_{t+1} =
\begin{cases}
\Pi(\tilde{x}_{t+1}) & \text{if } \sigma(t)=1, \\
\tilde{x}_{t+1} & \text{if } \sigma(t)=0.
\end{cases}
$$

这一公式统一了标准策略:**终端校正**对所有 $t < T$ 设置 $\sigma(t)=0$,**逐步校正**设置 $\sigma(t)=1$。更一般地,我们考虑预算约束的调度,其中 $\sum_{t=0}^{T-1} \sigma(t) \le B$。

为了在线实现这一目标,我们定义单步约束缺陷为提议状态与约束集之间的距离:

$$ s_t = \text{dist}(\tilde{x}_{t+1}, \mathcal{M}). $$

我们的在线预算策略基于阈值比较。在每一步 $t$,令 $b_t$ 为剩余预算。如果 $b_t > 0$ 且 $s_t \ge \lambda_{t,b_t}$,则应用投影,其中 $\lambda_{t,b_t}$ 是依赖于剩余时间和预算的阈值。形式化地说:

$$
x_{t+1} =
\begin{cases}
\Pi(\tilde{x}_{t+1}) & \text{if } b_t > 0 \text{ and } s_t \ge \lambda_{t,b_t}, \\
\tilde{x}_{t+1} & \text{otherwise}.
\end{cases}
$$

如果应用投影,剩余预算更新为 $b_{t+1} = b_t - 1$;否则 $b_{t+1} = b_t$。

对 $t$ 和 $b$ 的依赖至关重要:相同的缺陷在展开后期可能值得校正(当剩余的未来机会很少时),但在早期则不然(当调度器应为更大的未来偏离预留预算时)。因此,$\lambda_{t,b}$ 实现了基于剩余视域和校正预算的在线边际价值阈值。

阈值 $\lambda_{t,b}$ 决定了调度器多么积极地花费其剩余的校正资源。原则上,它们近似于预算分配问题的价值边界:当观测到的缺陷大到足以证明消耗一个单位预算合理时,应用校正。在第4节中,阈值是通过估计...

相似文章

具有全局约束的激励广告生成式优化

arXiv cs.LG

本文提出GOAL,一种约束感知的生成式激励广告框架,将激励分配建模为条件序列生成问题,并引入SCPO来学习一个能够跨ROI约束泛化的单一生成策略。实验表明,该方法在降低ROI违规率的同时,改善了长期收入和用户留存。

用于条件生成压缩感知的主动学习

arXiv cs.LG

本文提出了一个条件生成压缩感知框架,证明了基于提示词条件化模型在稳定恢复方面的界限,并通过在 Stable Diffusion 上的实验展示了提示词匹配如何影响采样分布。