标签
本文提出一种双向潜在扩散模型,可让动力系统在时间上向前或向后步进,并利用往返一致性作为自监督的测试时误差信号,在无需真实值或集成的情况下预测展开误差。
本文介绍了EddyFlow,一个用于公里级海面温度降尺度的深度学习框架,它在预测精度、尺度相关结构和区域泛化之间取得平衡。该框架在多个海洋区域实现了强大的零样本性能和近乎理想的频谱保真度。
This thesis introduces polynomial representations for long-term traffic scene prediction in autonomous driving, showing improved computational efficiency, generalization, and prediction plausibility over sequence-based baselines, validated on Argoverse 2 and Waymo Open datasets.
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
介绍了FairDiffuseVQVAE,一种两阶段表格扩散模型,通过在采样时以受保护属性为条件来实现公平性,在人口统计均等和均等化几率方面优于以往的公平表格生成器。
这篇bioRxiv预印本介绍了Diff-Switch框架,该框架利用基于扩散的系综采样生成构象状态,用于从头设计蛋白质开关,从而提高找到开关兼容序列的成功率。
本文介绍了合成自引导(Synthetic Self-Guidance, SSG)方法,该方法将一个轻量级预测头附加到冻结的预训练像素空间扩散模型上,在采样过程中利用中间预测与最终预测之间的差异作为自引导。研究表明,模型生成的样本足以训练这个预测头,在无需分类器自由引导(CFG)的情况下,多个变体的FID降低了50%以上,并且增强了使用CFG的强基线。
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
本文介绍了SGFlow,一种为扩散模型学习流图的方法,该方法避免了可逆性约束和通过模型迭代的反向传播,在CIFAR上取得了有竞争力的FID分数,并具有经过证明的稳定点保证。
本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。
提出神经形态掩码扩散语言模型(N-MDLMs),该模型将块扩散与基于尖峰的神经形态计算相结合,通过利用稀疏性和每次参数访问生成多个token来提高吞吐量和能效,并通过类屋顶线模型进行分析。
介绍了GenTO,一种基于扩散模型的框架,通过引导拓扑分布实现架构超材料的统一设计,利用可复用的拓扑先验和实验验证完成多种设计任务。
PRESTO 提出了一种用于扩散推测解码的前缀对齐树状草稿生成框架,在专用扩散草稿模型上实现了高达 1.5 倍的加速,在自推测扩散大语言模型上实现了 1.12 倍的加速。
本文提出了DiffDiff,一种用于概率时间序列预测的扩散框架,它将可预测性不对称性嵌入到扩散轨迹中,在四个预测跨度的七个基准测试上优于六个扩散基线。
本文通过一个代价元组将十二种连续时间生成模型统一在平均场博弈论框架下,介绍了MFGLab(一个自动共享训练循环和求解器的PyTorch库),并提出了使用可微熵函数以改善模式覆盖的DI-Flow。
SeT-Diff提出了首个面向HPC遥测的基础模型,利用基于语义传感器描述的扩散机制,在插补、预测和虚拟传感等任务上实现零样本泛化,重建任务的MAE达到0.0470。
介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。
并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。
对基于扩散的医学图像修复方法的系统性综述,涵盖架构、应用、数据集和评估策略,提出了分类方法并识别了挑战(如缺乏标准化基准)。