标签
此拉取请求在 llama.cpp 中为 MTP draft 启用 CUDA 图,以提升 GPU 上 LLM 推理的性能。
DominoTree引入了一种无训练的最佳优先草稿树用于投机解码,利用Domino的条件(非分解)修正,在Qwen3模型上实现了高达6.6倍的自回归解码加速,并且在所有评估方法中取得了最高的平均接受长度。
一位研究人员推出了Shard,在跨开放互联网的6块消费级GPU上分布式的744B参数模型实现了30 tok/s推理,相较之前的方法提升了15-20倍。
A tweet advocating that every AI researcher should understand inference acceleration and highlighting CUDA Graph as a core component of the vLLM server for GPU efficiency.