标签
Self-OPD 引入了一种无需教师的同策略蒸馏框架,用于流匹配模型。该框架利用自探索的随机分支和归一化优势来优化速度场,在多目标对齐方面超越了先前的方法。
介绍了重整化群流匹配(RGFM),这是一种生成框架,利用重整化群流进行可扩展的局部生成建模,从而提高全局一致性和计算效率。
本文介绍了untied self-conditioning以修正流匹配语言模型中的训练-推理不匹配问题,在无需重新训练的情况下,以更低的困惑度改进少步生成质量。
GameWAM 引入了首个统一的世界动作模型,用于原生视频游戏控制,通过块因果流匹配和模式特定分布联合预测未来视觉和可执行动作。
TracingFlow是一个无模拟框架,使用二阶动力学进行轨迹推断,提高了在单细胞组学数据中捕捉高曲率转变的准确性。
ForeTime-VLA引入了一种从世界动作模型中提取因果未来令牌的蒸馏方法,以提高动态传送带操作的性能,与现有VLA策略相比,实现了更高的抓取成功率。
本文研究了使用flow matching在表格数据上的无监督异常检测,重点关注受污染的训练集,并比较不同的评分方法以增强鲁棒性。
本文将流形漂移确定为流偏好优化中奖励黑客攻击的根本原因,并介绍了ThermoDPO,一种温度控制的方法,该方法将优化锚定在偏好样本上,以保持数据流形的完整性并提高性能。
本文介绍了GALA,这是一种用于文本到时间序列合成的两阶段方法,它使用生成感知跨模态对齐在TSFragment-600K基准测试中实现了最先进的结果,同时提高了保真度和标题一致性。
PixRestore是一种无VAE的像素空间扩散变换器,用于统一图像恢复,通过流匹配和对抗性微调至单步生成器,实现高保真度和效率。
Proposes ReCoGen, a two-stage framework for multimodal-conditioned time-series generation under irregular missingness, achieving state-of-the-art downstream utility on physiological benchmarks.
MiniMax 发布 Music 3,一款高性能音乐生成模型,可根据歌词和详细描述生成最长五分钟的完整歌曲,配备 8B 全局大语言模型和 0.6B 局部大语言模型,以实现长程连贯性和声学细节。
本文介绍了对抗式弗雷歇距离(AdvFD),它在静态弗雷歇损失的基础上增加了一个可学习的对抗性特征空间,以改进生成器的后训练,并通过真实特征白化来稳定优化过程。
This paper introduces Task-Conditional Flow Matching (TCFM), a framework for adapting multilingual text embedding models that selectively uses flow matching for translation tasks and other objectives for retrieval/classification. It achieves state-of-the-art results on the Indic Massive Text Embedding Benchmark.
能量引导流匹配通过使用移动端点和自适应调度改进生成图像质量,以降低的训练成本达到最先进FID分数。
SimWAM是一种简单而有效的世界动作模型,用于端到端自动驾驶,它将视频生成纯粹用作训练信号,在NAVSIM上实现了最先进的91.5 PDMS,同时降低了推理延迟。
Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。
提出了分位数耦合流匹配(QC-FM),这是一种轻量级的单侧耦合方法,它沿着随机方向从数据秩构建源样本,无需成对成本矩阵或分配。在CIFAR-10、CelebA、FFHQ和ImageNet-64上,相比基线实现了高达12.9%的FID改进。
本文介绍了DRIFT,一种针对流匹配视觉-语言-动作模型(如pi0和pi0.5)的对抗性补丁攻击,表明先前的鲁棒性声明是虚幻的,并且仅攻击第一步去噪既更强又更便宜,能破坏LIBERO基准套件中几乎所有可解决的任务。
Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。