标签
论文提出了 EHRFlow,一个多边际流匹配框架,该框架以编码后的患者历史为条件,从不规则的电子健康记录中学习连续时间的患者轨迹。在包含超过一百万名患者的多个数据集上进行临床编码预测时,其表现优于自回归基线和不考虑历史的基线方法。
论文提出了逆向蒸馏遗忘(Inverse Distillation Unlearning, IDU)这一统一框架,能够在将多步流匹配或扩散教师模型蒸馏为高效单步学生模型的同时,抑制被遗忘训练数据的生成。该方法仅需教师模型和遗忘集样本,无需访问保留数据或辅助分类器。
FlowTool是一个将基于工具的图像编辑建模为流程匹配问题的框架,与自回归多模态模型相比,实现了更优的性能和效率。
NVAlign是一种直接梯度优化方法,用于微调文本到语音模型,以可靠地产生非语言声音如笑声和叹息,提高性能优于标准微调和flow-GRPO,同时保持自然度。
本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。
InternW0是来自Shanghai AI Laboratory的基础物理世界模型,联合学习视觉动态与机器人控制以实现高效的真实世界交互,在异质数据上训练,并在科学任务上进行评估。
本文提出了 CorrFlow,一个相关性引导的流匹配框架,用于从组织学图像预测空间转录组学,显式建模基因间依赖关系,以提高生成谱中的生物连贯性。
论文介绍了SolarFlowRefiner,一个感知细化的流匹配框架,用于将粗糙的ERA5数据降尺度为高分辨率的SolarCube场,展示了相对于独立生成和事后细化方法的一致改进。
本文介绍了探针引导,一种用于连续扩散语言模型中流匹配模型的新方法,该方法在无条件生成上实现了最先进的性能,并提升了多项选择问答基准,同时提供了对自引导的见解。
AntennaFlow是一个三阶段生成流模型框架,联合解决天线测试中的相位获取和偏移校正挑战,实现从稀疏仅幅度测量数据进行快速、无相位、无偏移向量的近场到远场重构。
本文提出了一种基于flow-matching的模型,用于利用ADS-B数据预测飞机轨迹,在概率轨迹预测方面性能超越传统方法。
Notes on the equivalence between ODE and SDE sampling in diffusion models, discussing conditions and practical changes.
GradRepair-ODE引入了一个可靠性框架,用于认证和修复神经网络ODE训练中的梯度,以解决科学机器学习和生成模型中的数值稳定性问题。
本文揭示了连续与离散流匹配之间的对偶性,表明通过逐位置argmax投影连续凸插值路径可得到离散流,并探讨了不同源几何如何影响过渡时机和生成质量。
StepAudio 3 Music 介绍了一个大规模、长篇音乐生成模型,通过 ABC-CoT 实现显式音乐规划,在音频质量和相似度指标上取得了高分,与其他系统相比表现优异。
Marigold V2通过单步推理和新颖的微调协议,改造扩散变换器用于单目深度估计,实现了更清晰的深度图,并在KITTI和ETH3D等基准测试上取得了显著改进。
本文介绍了Quantile AlignTree Flow Matching (QAT-FM),这是一种用于流匹配的结构化耦合方法,通过使用分位数对齐树构建层次化耦合,以实现非交叉路径和高效的高维生成任务训练。
本文提出了CAT-OV和CAT-OT两种轻量级、无需训练的算法,它们基于曲率自适应调整流匹配采样中的步长,提升图像质量并将生成步数最多减少40%。
本文提出了GeoLAMP,一种几何感知的潜变量自回归生成模型,用于在复杂几何结构中求解多物理场偏微分方程,采用双编码器架构和因果自注意力变换器结合流匹配,以实现稳定且可扩展的预测。
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。