标签
本文介绍了Weaver,一种轻量级的自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树,相对于自回归解码实现了4.37倍的加速,并且比DFlash基线高出24.7%。
本文介绍了TwELL和Hybrid稀疏格式,配合自定义CUDA内核,有效利用LLM中的非结构化稀疏性,在H100 GPU上实现了训练和推理速度提升超过20%,同时降低了能耗和内存使用。
Atlas 是一个纯 Rust 实现的 LLM 推理引擎,通过为每种硬件×模型×量化组合定制 CUDA 内核,实现了比 vLLM 和 TensorRT-LLM 更快的推理速度。