标签
本文提出了缺失数据流匹配(Missing-Data Flow Matching)方法,该方法将训练样本中缺失的坐标视为潜在变量,并在可能取值上对流匹配损失进行平均。理论分析表明该修正是精确的,并提供了设计指导,实验在表格数据上验证了该方法的有效性。
AURORA-LM 提出了一种连续潜空间扩散语言模型,将可解码的文本表示与分布建模分离,在 OpenWebText 和 XSum 上取得了强劲性能,并扩展到 1B 参数规模。
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。
本文介绍了潜核离散流映射(LKF),一种用于离散扩散模型的流映射核,通过共享潜变量捕捉位置之间的相关性,无需蒸馏即可实现少步生成,并改善了文本生成的困惑度。
SE(3)-MeanFlow 提出了一种在李群上进行蛋白质骨架生成的少步生成框架,将 MeanFlow 扩展到 SE(3),采用闭式平均速度训练目标和基于修正的后训练,在减少采样步数的情况下达到或超过流匹配基线。
本文介绍了 PlatformBid,这是首个从统一广告平台视角设计的综合性自动出价基准,以及 BidFlow,一种基于流匹配的新型自动出价方法。实验表明,在快手在线测试中,BidFlow 将目标成本提升了 +0.68%。
FMOPF 使用潜在流匹配与约束感知交互先验,为交流最优潮流生成多样化、可行且接近最优的解,能扩展到数百个节点同时保持可行性。
Meshy T2 引入了一个基于流匹配的快速原生网格生成框架,结合顶点集网格 VAE,实现了最先进的几何保真度,端到端图像到网格生成中位时间仅 6 秒,比自回归基线快一个数量级以上。
并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。
本文引入了一种依赖感知的保真度诊断方法,用于测量合成表格数据中的列间依赖关系,揭示了标准指标对依赖关系视而不见,当前的生成器存在一个残余差距,无法通过增加容量或常见修复来弥补。
发布了一个模型(Stereo2Spatial),可将立体声音乐曲目转换为空间化双声道混音,采用流匹配扩散和振幅提升技术以实现稳定训练。该模型及一款Windows应用均以Apache 2.0许可证开源。
FreyaTTS 是一款紧凑型、无需分词器的土耳其语优先文本转语音模型,基于非自回归条件流匹配扩散变换器,以远小于大型系统的参数量实现了最先进的性能,并基于 Apache-2.0 许可发布。
本文介绍了Reward Transport方法,该方法在流匹配训练中使用最优传输耦合,将标量噪声坐标与分子奖励对齐,从而在推理时无需额外计算即可实现对logP和QED等分子属性的单调控制。
本文介绍了截断跳跃采样(Truncated Jump Sampling, TJS),这是一种无需训练的方法,通过利用端点可解码性加速扩散模型和流匹配模型的生成,将神经函数评估次数减少20-70%,同时在多个模型上保持接近匹配的质量。
Flow-ERD是一个多智能体交通仿真器,结合了智能体类型感知流匹配与熵正则化蒸馏,以实现既真实又多样化的运动模式,在WOSAC测试基准上排名第一。
作者分享了构建一个小型流匹配图像生成模型的经历,该模型基于 Apple 表情符号图像进行训练,描述了最初失败的方法以及后来成功转向使用 RGB 通道、残差块和注意力的过程。
感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。
提出量子流匹配(Quantum Flow Matching, QFM),一种利用自旋Wigner函数和功能流匹配来学习并生成多量子比特量子分布的生成模型,能够准确捕捉纯度和纠缠熵等物理性质。
提出SNAP-FM方法,利用稀疏GPU非线性优化加速物理约束生成建模中的约束投影,在保持精确物理约束满足的同时实现更快的推理。