roofline-model

标签

Cards List
#roofline-model

自回归模型量化中权衡速度与质量的层重要性度量

arXiv cs.LG ↗ · 2026-08-28 缓存

本文提出了一种针对小型大型语言模型量化的一体化度量标准,通过结合信息保留和吞吐量增益来平衡速度和质量,并在如Gemma 3 1B等模型上进行了评估。

0 人收藏 0 人点赞
#roofline-model

生命周期最优分词:词汇表大小作为部署场景相关的基础设施参数

arXiv cs.LG ↗ · 2026-08-13 缓存

本文认为最优分词器词汇表大小并非固定不变,而是取决于部署场景,例如批大小和推理量。通过roofline分析以及在A10G和A100 GPU上的实验,本文展示了在端侧部署和数据中心服务之间,生命周期最优词汇量可变化多达16倍,且对质量影响极小。

0 人收藏 0 人点赞
#roofline-model

@charles_irl: 如果你对投机解码感兴趣,花点时间钻研这张图表!并阅读 @haoailab.ht 的文章…

X AI KOLs Timeline ↗ · 2026-07-07 缓存

来自 LLM工程师年鉴 的屋顶线模型估计了在不同模型和硬件上,不同草稿长度下投机解码的加速效果,并附注指出,当开销显著时,该模型可能低估收益。

0 人收藏 0 人点赞
#roofline-model

@charles_irl: 周五,我们发布了六个用于加速推理的最新先进草稿模型。我们还发布了一篇关于为何……的博文

X AI KOLs Following ↗ · 2026-06-22 缓存

周五,我们发布了六个用于加速推理的最新先进草稿模型,同时发布了一篇关于推测解码的博文,以及一个用于估算加速比的山脊线模型工具。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈