标签
本文构建了一个用于扩散模型训练中噪声水平最优分配的统计框架,表明在耦合机制下最优调度是原子化的,而在独立学习机制下遵循平方根熵代理,实验证实了这些预测。
本文提出频谱对齐(SPA),一种轻量级的引导方法,通过校准中间预测的功率谱来减少扩散模型中的曝光偏差,在像素空间、潜在空间和流匹配模型上均展现出持续改进,且计算开销极小。
Nunchaku 是一款基于 SVDQuant 的 4-bit 扩散推理引擎,现已原生集成到 Hugging Face Diffusers 中,通过简单的 from_pretrained() 调用即可快速、节省内存地加载量化扩散模型。
本文解决了扩散模型在评分函数对混合权重不敏感时仍能准确恢复混合权重的悖论,引入了扩散评分敏感性指数(DSSI),并表明中间噪声级别为权重恢复提供了信息性信号。
提出DiFA,一种无需训练的框架,将推理时的数据预测优化重新定义为使用卡尔曼滤波的序列状态估计,显著提升了CIFAR-10和ImageNet上的生成保真度。
NVIDIA NeMo Automodel 与 Hugging Face Diffusers 集成,支持对扩散模型进行可扩展的分布式微调,用于图像和视频生成,支持的模型包括 FLUX.1-dev、Wan 2.1 和 HunyuanVideo。
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
介绍了自校正耦合马尔可夫跳跃过程(SC-CMJP)及一种无需训练的采样器CO2Jump,用于并行图像理解与生成,在编辑、迷宫和nonogram任务上实现了最先进的联合性能。
Google Research 表明,扩散模型的创造力是神经网络正则化导致得分平滑和插值的数学结果,揭开了它们能够生成新数据而不仅仅是记忆的能力的神秘面纱。
本文提出了 ReDiTT,一种面向异步时间序列预测的检索增强条件扩散Transformer。该模型检索结构相似的潜在序列作为参考条件,以改进长时域预测和样本多样性,在七个真实数据集上取得了最先进的性能。
本文提出了一种基于扩散的框架,用于学习条件于观测到的偏微分方程动力学的自适应网格离散化,利用谱引导和物理约束在需要的地方分配分辨率。该方法在五种偏微分方程场景中取得了具有竞争力或更优的性能。
本文利用广义外信息传递(GEXIT)函数为扩散模型建立了守恒律,表明交叉熵可以表示为沿噪声路径的局部信息论导数的积分,从而统一了离散和连续扩散的似然表征。
本文对扩散模型中的变分量子电路进行了公平比较研究,引入了一个挤压-激励(SE)骨架来隔离量子贡献。研究发现与经典对照的功能对等性,并识别了基于分数的设置中的角度嵌入失败,提供了严格的方法论和机理分析。
BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。
MetaView 提出了一种基于扩散的单目新视角合成框架,该框架结合了隐式几何先验与度量深度引导,能够在单张图像的大视角变化下实现一致且可控的渲染。
介绍 InfiniteDiffusion,一种无需训练的算法,使扩散模型能够生成无边界、种子一致的地形,并具有恒定时间的随机访问能力,弥合了学习保真度与程序化实用性之间的差距。Terrain Diffusion 框架展示了具有地球尺度动态范围的交互式速率真实地形生成。
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。
本文引入了分析可解的贝叶斯信息受限扩散(BIRD)模型,用于研究扩散模型中的记忆-泛化相变,发现生成过程接近记忆边缘,且信息限制有助于规避维度灾难。