标签
AgSpec 是一个检索式推测解码框架,通过从会话、工作区和全局语料中检索草稿并动态调整草稿长度,在多智能体编码基准上实现了最高 4.37 倍(batch size 1)和 4.76 倍(batch size 16)的生成吞吐提升,优于五种现有检索式草稿器和 EAGLE-3。
KVCMAS引入了一个用于多智能体系统的高效KV缓存修正框架,该框架减少了计算和内存开销,同时实现更快的推理并保持准确性。
清华大学和无问芯穹团队开源了一篇论文,介绍了C2C,一种通过缓存融合实现大型语言模型直接通信的方法,消除了文本中介,显著提升了推理速度和准确性。
ASPIRE是一种异步分块自推测解码框架,通过支持独立请求调度并减少注意力机制的陈旧性,显著提升了长上下文大语言模型的推理性能,实现了1.70至4.58倍的基准加速效果。
ActionSplice 引入反事实状态传输,将修订后的动作插入块自回归视频世界模型,无需重放已完成的评估,从而提高保真度和推理速度。
TreeGraft引入了一个用于树基推测解码的多草稿器框架,通过自适应调度优化草稿树质量,以实现比单草稿器方法显著的推理加速。
NVIDIA展示了如何使用NVIDIA模型优化器进行量化感知蒸馏(QAD)来改进Nemotron 3.5 Lightning模型,在保持代理基准准确性的同时减少内存使用并提高吞吐量。
LiquidAI发布了用于推测解码的草稿模型,以加速其LFM2.5模型,在H100和Apple硅芯片上实现高达2倍的推理加速,且不降低质量。
DFlash 2 是一个用于投机解码的块扩散草稿模型,可提升 Qwen3.8-27B 语言模型的推理速度,在基准测试中提供更高的接受长度和吞吐量。
该论文介绍了Mobius-v0,一种将知识存储与推理解耦以提升效率的架构,表明一个7B模型在62.6%的训练数据下能达到可比性能,而Intern-S2-Mobius实现了4倍推理加速。
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
探索通过预测下一个token将使用的MoE专家来改进CPU/GPU offload,实现了30->150-200 tg/s的加速,并质疑实现可行性。
mlx-dspark 将 DeepSeek 的 DSpark 和 z-lab 的 DFlash 推测解码草稿模型通过 MLX 引入 Apple Silicon,实现无损加速(约 1.4–1.6 倍,代码/数学任务可达 2 倍),并提供兼容 OpenAI 的 API 用于本地推理。
在 llama-server 中,Ornith 35B 与 Qwen3.6 35B DFlash 推测模型搭配使用时,token 生成速度提升了 30-40%,在混合代码和文本上实现了 80% 的接受率,但提示处理性能有所下降。
本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。
MeshFlow 引入了一种等变最优传输流匹配模型,用于直接生成三角形网格,在达到最先进质量的同时,相比自回归方法提供了约18倍的推理加速。
本文提出了dMoE,一种用于扩散大语言模型的块级混合专家框架,该框架将词元级专家分布聚合成块级路由,在保持性能的同时减少激活的专家数量和内存使用。
Domino是一个推测解码框架,它将因果依赖建模与自回归草稿生成解耦,采用并行主干和轻量级因果精炼头,在Qwen3模型上实现了高达5.49倍的端到端加速。
SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。
Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。