标签
本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。
InternW0是来自Shanghai AI Laboratory的基础物理世界模型,联合学习视觉动态与机器人控制以实现高效的真实世界交互,在异质数据上训练,并在科学任务上进行评估。
本文提出了 CorrFlow,一个相关性引导的流匹配框架,用于从组织学图像预测空间转录组学,显式建模基因间依赖关系,以提高生成谱中的生物连贯性。
论文介绍了SolarFlowRefiner,一个感知细化的流匹配框架,用于将粗糙的ERA5数据降尺度为高分辨率的SolarCube场,展示了相对于独立生成和事后细化方法的一致改进。
本文介绍了探针引导,一种用于连续扩散语言模型中流匹配模型的新方法,该方法在无条件生成上实现了最先进的性能,并提升了多项选择问答基准,同时提供了对自引导的见解。
AntennaFlow是一个三阶段生成流模型框架,联合解决天线测试中的相位获取和偏移校正挑战,实现从稀疏仅幅度测量数据进行快速、无相位、无偏移向量的近场到远场重构。
本文提出了一种基于flow-matching的模型,用于利用ADS-B数据预测飞机轨迹,在概率轨迹预测方面性能超越传统方法。
Notes on the equivalence between ODE and SDE sampling in diffusion models, discussing conditions and practical changes.
GradRepair-ODE引入了一个可靠性框架,用于认证和修复神经网络ODE训练中的梯度,以解决科学机器学习和生成模型中的数值稳定性问题。
本文揭示了连续与离散流匹配之间的对偶性,表明通过逐位置argmax投影连续凸插值路径可得到离散流,并探讨了不同源几何如何影响过渡时机和生成质量。
StepAudio 3 Music 介绍了一个大规模、长篇音乐生成模型,通过 ABC-CoT 实现显式音乐规划,在音频质量和相似度指标上取得了高分,与其他系统相比表现优异。
Marigold V2通过单步推理和新颖的微调协议,改造扩散变换器用于单目深度估计,实现了更清晰的深度图,并在KITTI和ETH3D等基准测试上取得了显著改进。
本文介绍了Quantile AlignTree Flow Matching (QAT-FM),这是一种用于流匹配的结构化耦合方法,通过使用分位数对齐树构建层次化耦合,以实现非交叉路径和高效的高维生成任务训练。
本文提出了CAT-OV和CAT-OT两种轻量级、无需训练的算法,它们基于曲率自适应调整流匹配采样中的步长,提升图像质量并将生成步数最多减少40%。
本文提出了GeoLAMP,一种几何感知的潜变量自回归生成模型,用于在复杂几何结构中求解多物理场偏微分方程,采用双编码器架构和因果自注意力变换器结合流匹配,以实现稳定且可扩展的预测。
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
Flow-JEPA 引入了一种条件流匹配方法到 JEPA 世界模型中,提高了在嘈杂条件下预测未来潜在状态的鲁棒性和准确性。
本文介绍了用于等变图生成的Gromov-Monge流匹配,通过与标准架构兼容的结构感知耦合来提高样本质量。
GameWAM引入了首个用于视频游戏原生闭环游戏玩法和GUI控制的世界动作模型,联合生成视觉观察和可执行动作,具有竞争力的任务成功率,并揭示了源敏感性故障模式。
本文介绍了Drift Variation自动编码器,它使用条件后验流匹配来统一生成和表示学习,在受控多模态基准测试中实现了高性能。