@PyTorch: 激动宣布EAGLE 3.1 - 来自@EagleCorp的推测解码下一代演进,由@hongyangzh开发,…
摘要
EAGLE 3.1,推测解码的下一代演进,引入了新的FC归一化以提高效率,由EagleCorp与PyTorch、vLLM和TorchSpec合作开发。
激动宣布EAGLE 3.1 - 来自@EagleCorp的推测解码下一代演进,由@hongyangzh、@dogacel0以及EAGLE团队与vLLM @vllm_project和TorchSpec @lightseekorg合作开发!EAGLE 3.1引入了新的FC归一化+
相似文章
Eagle 3.1:EAGLE团队、vLLM团队和TorchSpec团队之间的合作
EAGLE 3.1通过后归一化架构提升了推测解码的鲁棒性,在长上下文工作负载中实现了长达2倍的接受长度,并获得了TorchSpec的训练支持及集成到vLLM中。
EAGLE3 已登陆 llama.cpp
EAGLE3 是一种推测性解码方法,现已集成到 llama.cpp 中,能够实现更快的推理。
@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…
关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。
@Ex0byt: 浅谈specdec的多种风格,以及我为何尝试为各位制作Qwen-3.6-27b EAGLE-3草稿模型
讨论了推测解码的多种风格,并尝试为社区制作一个Qwen-3.6-27b EAGLE-3草稿模型。
AngelSpec:面向实际场景的高性能推测解码推理
AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。