标签
本文提出了一种针对小型大型语言模型量化的一体化度量标准,通过结合信息保留和吞吐量增益来平衡速度和质量,并在如Gemma 3 1B等模型上进行了评估。
本文认为最优分词器词汇表大小并非固定不变,而是取决于部署场景,例如批大小和推理量。通过roofline分析以及在A10G和A100 GPU上的实验,本文展示了在端侧部署和数据中心服务之间,生命周期最优词汇量可变化多达16倍,且对质量影响极小。
来自 LLM工程师年鉴 的屋顶线模型估计了在不同模型和硬件上,不同草稿长度下投机解码的加速效果,并附注指出,当开销显著时,该模型可能低估收益。
周五,我们发布了六个用于加速推理的最新先进草稿模型,同时发布了一篇关于推测解码的博文,以及一个用于估算加速比的山脊线模型工具。