标签
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
CORA-Diff is a training-free method that accelerates diffusion language model inference by using native confidence and persistence signals to accept residual positions early, skipping redundant dense denoising passes while preserving task quality.
Introduces Archer, a training-free KV caching method for diffusion language models that adaptively reuses cached hidden states to reduce recomputation while preserving rollback capabilities, achieving up to 2.95x speedup and improved generation quality.
本文提出GenCDSR,一种用于跨域序列推荐的生成式框架,采用混合分词与串并化解码,在准确率上优于现有最优基线,并将推理延迟显著降低。
MUGEN 提出了一个统一的运动-语言框架,避免了离散码本和迭代解码,使用带有连续潜变量槽位的单一自适应长度自编码器以及一次性生成,在 HumanML3D 和 SnapMoGen 基准上实现了高效、高质量的文本到运动与运动到文本性能。
DIRECT是一个使用大型语言模型进行序列标注的框架,通过监督微调后的直接偏好优化(DPO)改善领域对齐,并通过带有模板填充和KV缓存重用的受控解码提高推理效率。
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。