标签
这条推文讨论了越来越多地使用连续流模型来处理像语言生成这样的离散任务,提出了一种方法来将词汇表示为独热向量,并在连续空间中学习流。
本文介绍了 Newton Matching,这是一种用于生成模型微调和采样的统一框架。它通过将学习视为迭代优化过程并利用条件匹配结构,解决了现有方法的局限性。
PathGuide 将无分类器引导的选择重新表述为基于流的生成模型中的在线策略传输问题,利用连续性方程的弱形式动态优化引导尺度,以提高样本保真度。
本文介绍了 ActFlow,这是一种持续预训练方案,旨在扩展流模型和扩散模型的有效设计空间,从而实现分布外生成建模,并为科学发现提供可进化的搜索空间。
本文提出MeanFlow-Transfer(MF-T)和连续对抗性MeanFlow(CAMF),以统一预训练扩散和流动模型的适配和加速,实现数据有限新领域的高质量少步生成。
GS-Voxel引入了一个无需拟合的框架,将3D Gaussian Splatting重建转换为结构化潜变量,通过流模型和分块推理实现大规模空中3D场景的可扩展生成。
介绍了CrystalGRPO,一个用于流基晶体结构预测的强化学习后训练框架,它对齐目标恢复并保持候选覆盖,在MP-20和MPTS-52基准上提升了Top-1和Top-20性能。
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。
MeanFlowNFT为平均速度生成器引入了一种前向过程强化学习方法,能够在保持快速少步采样的同时,高效地与人类偏好对齐。实验表明,它在大多数指标上优于先前经过强化学习调优的少步生成器,甚至超越了多步调优的扩散模型。
Flow Reasoning Models (FRMs) 为离散流模型在结构化推理任务上引入了一个训练和测试时扩展框架。通过使用 self-verification 和 self-conditioning,FRMs 在 Sudoku 和 Zebra 谜题上达到了近乎100%的求解率,而所需的迭代次数远少于之前的基准模型。
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
FlowBender 是一个闭环框架,通过训练网络利用推理时反馈来纠正对齐误差,从而提升扩散模型和流模型中的约束满足能力,优于传统的监督方法和基于引导的方法。
提出将流程步骤视为 RL 动作,并结合“流反转”技术用于流程离线强化学习。
QGF 是一种强化学习算法,通过使用价值梯度来指导预训练的流策略,在测试时改进策略,避免了训练时的不稳定性,同时保持了竞争力的性能。
本文解释了奖励引导的流模型和扩散模型中奖励作弊的根本原因,将其归因于Doob h函数的有限粒子插件估计,并提出了一种奖励阻尼调度方案,在不增加计算成本的情况下校正模态内偏差。
介绍了约束流优化(CFO)框架,该框架通过微调生成流模型,在分子设计中最大化奖励的同时满足约束,具有理论保证和实验验证。
本文识别了组合奖励下引导流模型中的流形外漂移,并提出冲突感知加性引导(CAR),这是一种轻量级方法,可动态解决梯度冲突,从而无需重新训练即可提升生成保真度。
Flow-Direct 提出了一种用于基于流的生成模型的非参数引导场,该引导场持续累积奖励反馈,提高了反馈效率,并使得收集的样本可重复用于引导多目标生成,无需额外的奖励评估。