标签
本文介绍了Consistency Forcing(CForce),一种针对扩散大语言模型的蒸馏技术,通过将早期阶段的预测与后期阶段对齐来提升并行解码,从而改善速度-质量权衡。
提出了Ripple-Pivot Search,一种无需训练的扩散大语言模型解码方法,主动确定中熵枢轴位置以减少不确定性并加速并行解码,实现4-10倍加速。
SLIM-RL 提出了一种基于风险预算的随机掩码强化学习方法,用于扩散语言模型,避免了轨迹切分,在数学和代码基准测试中以显著更少的训练样本取得了最先进的结果。
一篇新帖子强调了扩散LLM的一个缺点:双向注意力机制导致键值跨步骤漂移,破坏了KV缓存。不过,生成质量对轻微的KV漂移具有鲁棒性,研究重点已放在最大化陈旧KV重用而不导致质量下降上。
WaveFilter提出了一种无需训练的小波引导KV缓存过滤框架,用于扩散大语言模型,通过精确识别关键令牌并构建稀疏缓存来增强长上下文能力,从而提升复杂长上下文任务的性能。
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。
本文介绍了 WINO 和 WINO+,这两种方法能够在扩散大语言模型中实现可撤销的并行解码,并提炼高效的降噪轨迹,显著改善质量-速度权衡。
本文介绍了 DARE,这是一种通过复用缓存的键值(KV)和输出激活来减少计算冗余,从而在几乎不损失质量的情况下提高扩散大语言模型推理效率的方法。