FlowBender: 自校正条件流的反馈感知训练

Hugging Face Daily Papers 论文

摘要

FlowBender 是一个闭环框架,通过训练网络利用推理时反馈来纠正对齐误差,从而提升扩散模型和流模型中的约束满足能力,优于传统的监督方法和基于引导的方法。

条件扩散模型和流模型通常会无法满足定义其任务的约束条件。例如,一个深度条件模型常常生成的图像,其重新提取的深度与输入不一致,尽管前向算子(即**定义约束的深度预测器**)在训练和推理时都是可用的。 现有方法通常分为两类:监督模型将条件信号视为静态线索,在推理时忽略对齐信息;基于引导的方法通过手动调整的线性更新来查询条件信息,通常需要在条件保真度和生成样本的合理性之间进行权衡。我们认为,这两种范式的根本缺陷在于**模型从未被训练利用自身的对齐误差**。 我们提出 FlowBender,这是一个闭环框架,将该误差视为一等输入,训练网络学习以推理时反馈为条件的校正策略。在每一步,一个无引导的前瞻过程估计干净信号,通过前向算子计算任务特定的偏差,然后一个精炼过程使用该信号生成校正后的速度。我们提出了 FlowBender 的多个变体,包括针对可微算子的基于梯度的公式,以及针对非可微设置(如 JPEG 压缩)的零阶变体。为了高效采样,我们引入了一个前一步捷径,以最小的额外计算成本实现闭环校正。 在图像到图像翻译、图像恢复和3D网格纹理绘制等任务中,FlowBender 始终优于标准监督基线、对齐损失增强训练以及最先进的推理时引导方法,同时提升保真度和合理性,而不是在两者之间进行权衡。项目页面:https://flow-bender.github.io/
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:28

论文页面 - FlowBender: 面向自修正条件流的反馈感知训练

来源:https://huggingface.co/papers/2606.20404

摘要

FlowBender 是一个闭环框架,通过训练网络利用推理时的反馈来修正对齐误差,从而解决扩散模型和流模型中的约束满足问题,在多个任务上均优于传统的监督方法和基于引导的方法。

条件扩散模型与流模型(https://huggingface.co/papers?q=flow%20models)常常无法满足定义其任务本身的约束条件。例如,一个深度条件模型生成的图像,其重新提取的深度常与输入深度不一致,即便用于定义约束的前向算子——深度预测器——在训练和推理阶段都是可用的。现有方法大致分为两类:一类是监督模型,将条件信号视为静态线索,在推理时忽略对齐信息;另一类是基于引导的方法,通过手工调整的线性更新来查阅该信息,通常需要在条件保真度和生成样本的合理性之间进行权衡。我们认为,这两种范式的根本差距在于模型从未被训练去利用自身的对齐误差(https://huggingface.co/papers?q=alignment%20error)。我们提出 FlowBender,这是一个闭环框架(https://huggingface.co/papers?q=closed-loop%20framework),它将这种误差作为一等输入,训练网络学习一个以推理时反馈为条件的修正策略。在每个步骤中,一次无引导的前瞻传递(https://huggingface.co/papers?q=unguided%20look-ahead%20pass)估计出干净信号,通过前向算子计算出任务特定的偏差,然后一次精炼传递(https://huggingface.co/papers?q=refinement%20pass)接收该信号并生成修正后的速度。我们提出了 FlowBender 的几种变体,包括针对可微算子的基于梯度的公式(https://huggingface.co/papers?q=gradient-based%20formulation),以及针对 JPEG 压缩等不可微场景的零阶变体(https://huggingface.co/papers?q=zero-order%20variant)。为了实现高效采样,我们引入了一种前一步捷径,使得闭环修正仅需极少的额外计算成本。在图像到图像翻译(https://huggingface.co/papers?q=image-to-image%20translation)、图像恢复(https://huggingface.co/papers?q=restoration)和 3D 网格纹理贴图(https://huggingface.co/papers?q=3D%20mesh%20texturing)中,FlowBender 始终优于标准监督基线、基于对齐损失增强的训练以及最先进的推理时引导方法(https://huggingface.co/papers?q=inference-time%20guidance),同时提升保真度和合理性,而非在两者之间进行权衡。项目页面:https://flow-bender.github.io/

查看 arXiv 页面(https://arxiv.org/abs/2606.20404)查看 PDF(https://arxiv.org/pdf/2606.20404)项目页面(https://flow-bender.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20404)

在你的 agent 中获取这篇论文:

hf papers read 2606.20404

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.20404 即可从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.20404 即可从本页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.20404 即可从本页面链接。

包含此论文的收藏集1

相似文章

遵循均值:参考引导的流匹配

Hugging Face Daily Papers

本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。

探索Flow Matching中奖励反向传播的设计空间

Hugging Face Daily Papers

FlowBP提出了一个统一的代理轨迹框架,通过奖励反向传播将流匹配模型与人类偏好对齐,减少了内存使用和梯度链式传递,同时在多个文本到图像模型上保持了性能。