FlowBender: 自校正条件流的反馈感知训练
摘要
FlowBender 是一个闭环框架,通过训练网络利用推理时反馈来纠正对齐误差,从而提升扩散模型和流模型中的约束满足能力,优于传统的监督方法和基于引导的方法。
查看缓存全文
缓存时间: 2026/06/20 14:28
论文页面 - FlowBender: 面向自修正条件流的反馈感知训练
来源:https://huggingface.co/papers/2606.20404
摘要
FlowBender 是一个闭环框架,通过训练网络利用推理时的反馈来修正对齐误差,从而解决扩散模型和流模型中的约束满足问题,在多个任务上均优于传统的监督方法和基于引导的方法。
条件扩散模型与流模型(https://huggingface.co/papers?q=flow%20models)常常无法满足定义其任务本身的约束条件。例如,一个深度条件模型生成的图像,其重新提取的深度常与输入深度不一致,即便用于定义约束的前向算子——深度预测器——在训练和推理阶段都是可用的。现有方法大致分为两类:一类是监督模型,将条件信号视为静态线索,在推理时忽略对齐信息;另一类是基于引导的方法,通过手工调整的线性更新来查阅该信息,通常需要在条件保真度和生成样本的合理性之间进行权衡。我们认为,这两种范式的根本差距在于模型从未被训练去利用自身的对齐误差(https://huggingface.co/papers?q=alignment%20error)。我们提出 FlowBender,这是一个闭环框架(https://huggingface.co/papers?q=closed-loop%20framework),它将这种误差作为一等输入,训练网络学习一个以推理时反馈为条件的修正策略。在每个步骤中,一次无引导的前瞻传递(https://huggingface.co/papers?q=unguided%20look-ahead%20pass)估计出干净信号,通过前向算子计算出任务特定的偏差,然后一次精炼传递(https://huggingface.co/papers?q=refinement%20pass)接收该信号并生成修正后的速度。我们提出了 FlowBender 的几种变体,包括针对可微算子的基于梯度的公式(https://huggingface.co/papers?q=gradient-based%20formulation),以及针对 JPEG 压缩等不可微场景的零阶变体(https://huggingface.co/papers?q=zero-order%20variant)。为了实现高效采样,我们引入了一种前一步捷径,使得闭环修正仅需极少的额外计算成本。在图像到图像翻译(https://huggingface.co/papers?q=image-to-image%20translation)、图像恢复(https://huggingface.co/papers?q=restoration)和 3D 网格纹理贴图(https://huggingface.co/papers?q=3D%20mesh%20texturing)中,FlowBender 始终优于标准监督基线、基于对齐损失增强的训练以及最先进的推理时引导方法(https://huggingface.co/papers?q=inference-time%20guidance),同时提升保真度和合理性,而非在两者之间进行权衡。项目页面:https://flow-bender.github.io/
查看 arXiv 页面(https://arxiv.org/abs/2606.20404)查看 PDF(https://arxiv.org/pdf/2606.20404)项目页面(https://flow-bender.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20404)
在你的 agent 中获取这篇论文:
hf papers read 2606.20404
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.20404 即可从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.20404 即可从本页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.20404 即可从本页面链接。
包含此论文的收藏集1
相似文章
Flow-Direct: 通过非参数引导场实现高效反馈与可复用的流模型引导
Flow-Direct 提出了一种用于基于流的生成模型的非参数引导场,该引导场持续累积奖励反馈,提高了反馈效率,并使得收集的样本可重复用于引导多目标生成,无需额外的奖励评估。
Constraint-Aware Flow Matching: 面向约束采样的决策对齐端到端训练
提出了Constraint-Aware Flow Matching,一种新颖的端到端框架,将模型的学习动态与约束采样过程对齐,减轻了投影校正带来的分布偏移,从而实现高质量的约束生成。
AffectFlow-DINO: 基于条件修正流的不确定性感知多任务情感估计
本文提出了AffectFlow-DINO,一种用于第11届ABAW挑战赛的多任务学习系统,该系统采用条件修正流头来建模真实场景下面部行为估计中的不确定性,相比基线取得了显著提升。
遵循均值:参考引导的流匹配
本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。
探索Flow Matching中奖励反向传播的设计空间
FlowBP提出了一个统一的代理轨迹框架,通过奖励反向传播将流匹配模型与人类偏好对齐,减少了内存使用和梯度链式传递,同时在多个文本到图像模型上保持了性能。