标签
本文介绍Mean Velocity Matching (MVM),它使用一个单一的学习场来参数化扩散模型中的随机逆向动力学,使得能够进行随机和确定性采样,并具有竞争力的生成质量。
本文将顺序重现识别为Diffusion数据点遗忘过程中的失效模式,并提出一种锐度引导方法,以提升跨删除序列的遗忘持久性。
该论文为大型语言模型提出了一个统一的概率框架,通过概率测度描述模型,通过最大似然估计进行训练,并将文本生成视为随机模拟过程,同时对幻觉现象和扩散模型的作用提供了深入见解。
本文介绍了RecCAR,一种正则化方法,用于解决联合多模态扩散变换器中的互惠对应差距,从而提高视频生成任务的性能。
本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。
Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。
HyperQ 在冻结的掩码扩散语言模型中引入了令牌条件化的量子残差分支,使用电路超网络动态生成量子电路参数。这种方法在基准测试中提高了性能,并且计算效率高,与经典基线相比需要更少的微调示例。
本文介绍了SVEET,一个用于高质量流式视频编辑的框架,它利用预训练的视频扩散模型,实现自动回归编辑,并在单个GPU上实现实时性能。
UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。
本文介绍了推测性草稿树,通过丰富候选草稿和使用贪婪拒绝采样来加速扩散模型采样,实现了比基线方法高达8.3%的加速。
Video DeltaNet提出了一种混合注意力机制,结合Softmax和线性注意力,以提高视频生成模型的效率,实现了比基线方法快14.5倍的加速。
Linum AI 推出 JiT-DDT,这是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比之前的方法快3.6倍,同时生成更高分辨率的图像。
本文提出'Early-Bird Decoding',这是一个通过可学习块大小和并行采样来加速扩散大语言模型的框架,在不修改预训练权重的情况下实现了显著的吞吐量提升。
本文提出在扩散语言模型中使用注册令牌来维护跨生成块的有界状态推理,在数学和代码基准测试中显示出显著的提升,而无需完整保留上下文。
本文提出了一种离散扩散框架,用于高效的一对多机器翻译,实现了随目标语言数量次线性延迟扩展,并支持对未见源语言的零样本迁移。
Notes on the equivalence between ODE and SDE sampling in diffusion models, discussing conditions and practical changes.
ReCAST 提出了一种在扩散模型微调中实现按奖励、时间步依赖的信用分配方法,将用户偏好与时间分配分离,以提升对齐性和信息价值。
GradRepair-ODE引入了一个可靠性框架,用于认证和修复神经网络ODE训练中的梯度,以解决科学机器学习和生成模型中的数值稳定性问题。
本文提出了一种通过扩散模型利用Radon-Nikodym导数操纵似然性来实现受控离群点生成的方法,无需重新训练即可创建低似然性样本。
DCRA提出了一种扩散条件表示对齐框架,旨在增强时间序列学习的鲁棒性,尤其适用于脑电图(EEG)和心电图(ECG)等临床信号,通过对不同噪声水平下的表示进行对齐来实现。