标签
本文提出了DiffDiff,一种用于概率时间序列预测的扩散框架,它将可预测性不对称性嵌入到扩散轨迹中,在四个预测跨度的七个基准测试上优于六个扩散基线。
本文通过一个代价元组将十二种连续时间生成模型统一在平均场博弈论框架下,介绍了MFGLab(一个自动共享训练循环和求解器的PyTorch库),并提出了使用可微熵函数以改善模式覆盖的DI-Flow。
SeT-Diff提出了首个面向HPC遥测的基础模型,利用基于语义传感器描述的扩散机制,在插补、预测和虚拟传感等任务上实现零样本泛化,重建任务的MAE达到0.0470。
介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。
并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。
对基于扩散的医学图像修复方法的系统性综述,涵盖架构、应用、数据集和评估策略,提出了分类方法并识别了挑战(如缺乏标准化基准)。
本文构建了一个用于扩散模型训练中噪声水平最优分配的统计框架,表明在耦合机制下最优调度是原子化的,而在独立学习机制下遵循平方根熵代理,实验证实了这些预测。
本文提出频谱对齐(SPA),一种轻量级的引导方法,通过校准中间预测的功率谱来减少扩散模型中的曝光偏差,在像素空间、潜在空间和流匹配模型上均展现出持续改进,且计算开销极小。
Nunchaku 是一款基于 SVDQuant 的 4-bit 扩散推理引擎,现已原生集成到 Hugging Face Diffusers 中,通过简单的 from_pretrained() 调用即可快速、节省内存地加载量化扩散模型。
本文解决了扩散模型在评分函数对混合权重不敏感时仍能准确恢复混合权重的悖论,引入了扩散评分敏感性指数(DSSI),并表明中间噪声级别为权重恢复提供了信息性信号。
提出DiFA,一种无需训练的框架,将推理时的数据预测优化重新定义为使用卡尔曼滤波的序列状态估计,显著提升了CIFAR-10和ImageNet上的生成保真度。
NVIDIA NeMo Automodel 与 Hugging Face Diffusers 集成,支持对扩散模型进行可扩展的分布式微调,用于图像和视频生成,支持的模型包括 FLUX.1-dev、Wan 2.1 和 HunyuanVideo。
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
介绍了自校正耦合马尔可夫跳跃过程(SC-CMJP)及一种无需训练的采样器CO2Jump,用于并行图像理解与生成,在编辑、迷宫和nonogram任务上实现了最先进的联合性能。
Google Research 表明,扩散模型的创造力是神经网络正则化导致得分平滑和插值的数学结果,揭开了它们能够生成新数据而不仅仅是记忆的能力的神秘面纱。
本文提出了 ReDiTT,一种面向异步时间序列预测的检索增强条件扩散Transformer。该模型检索结构相似的潜在序列作为参考条件,以改进长时域预测和样本多样性,在七个真实数据集上取得了最先进的性能。
本文提出了一种基于扩散的框架,用于学习条件于观测到的偏微分方程动力学的自适应网格离散化,利用谱引导和物理约束在需要的地方分配分辨率。该方法在五种偏微分方程场景中取得了具有竞争力或更优的性能。
本文利用广义外信息传递(GEXIT)函数为扩散模型建立了守恒律,表明交叉熵可以表示为沿噪声路径的局部信息论导数的积分,从而统一了离散和连续扩散的似然表征。