latency-modeling

标签

Cards List
#latency-modeling

基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模

arXiv cs.LG ↗ · 2026-08-10 缓存

本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈