标签
本文介绍了 Simplax,一种用于离散扩散模型的精确狄利克雷-类别增强方法,它在保留原始类别损坏过程的同时丰富了训练目标和逆向转移,在 OpenWebText 上改善了困惑度-熵权衡,在 Sudoku 上提高了有效性。
This paper studies inverse sampling for Lévy-driven generative models, proposing a structured reverse sampler that decomposes dynamics into diffusion, small jump, and large jump components, with neural networks amortizing jump rates. The method is applied to OFDM-SISO channel estimation under mixed Gaussian and impulsive noise.
本文提出DURA,一种基于扩散的无限制机器人攻击方法,能够生成视觉上自然的对抗性补丁,在白盒和黑盒设置下干扰视觉-语言-行动(VLA)模型,凸显了物理部署机器人系统的安全风险。
Presents LibraSpec, a training-free, plug-and-play algorithm that dynamically selects speculative decoding lengths via marginal-gain-driven optimization, achieving consistent speedups across multiple models and benchmarks.
本文介绍了Atelier,一种在生成前规划显式控制状态以防止文本到图像模型陷入艺术家名称捷径的方法,并提出了ArtIntentBench以评估艺术家风格控制。
本文提出一种双向潜在扩散模型,可让动力系统在时间上向前或向后步进,并利用往返一致性作为自监督的测试时误差信号,在无需真实值或集成的情况下预测展开误差。
本文介绍了EddyFlow,一个用于公里级海面温度降尺度的深度学习框架,它在预测精度、尺度相关结构和区域泛化之间取得平衡。该框架在多个海洋区域实现了强大的零样本性能和近乎理想的频谱保真度。
本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。
This thesis introduces polynomial representations for long-term traffic scene prediction in autonomous driving, showing improved computational efficiency, generalization, and prediction plausibility over sequence-based baselines, validated on Argoverse 2 and Waymo Open datasets.
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
介绍了FairDiffuseVQVAE,一种两阶段表格扩散模型,通过在采样时以受保护属性为条件来实现公平性,在人口统计均等和均等化几率方面优于以往的公平表格生成器。
这篇bioRxiv预印本介绍了Diff-Switch框架,该框架利用基于扩散的系综采样生成构象状态,用于从头设计蛋白质开关,从而提高找到开关兼容序列的成功率。
本文介绍了合成自引导(Synthetic Self-Guidance, SSG)方法,该方法将一个轻量级预测头附加到冻结的预训练像素空间扩散模型上,在采样过程中利用中间预测与最终预测之间的差异作为自引导。研究表明,模型生成的样本足以训练这个预测头,在无需分类器自由引导(CFG)的情况下,多个变体的FID降低了50%以上,并且增强了使用CFG的强基线。
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
本文介绍了SGFlow,一种为扩散模型学习流图的方法,该方法避免了可逆性约束和通过模型迭代的反向传播,在CIFAR上取得了有竞争力的FID分数,并具有经过证明的稳定点保证。
本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。
提出神经形态掩码扩散语言模型(N-MDLMs),该模型将块扩散与基于尖峰的神经形态计算相结合,通过利用稀疏性和每次参数访问生成多个token来提高吞吐量和能效,并通过类屋顶线模型进行分析。
介绍了GenTO,一种基于扩散模型的框架,通过引导拓扑分布实现架构超材料的统一设计,利用可复用的拓扑先验和实验验证完成多种设计任务。
PRESTO 提出了一种用于扩散推测解码的前缀对齐树状草稿生成框架,在专用扩散草稿模型上实现了高达 1.5 倍的加速,在自推测扩散大语言模型上实现了 1.12 倍的加速。