latency-modeling

Tag

Cards List
#latency-modeling

Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

arXiv cs.LG ↗ · 2026-08-10 Cached

This paper introduces HYMELL, a hybrid analytical-machine-learning framework for estimating LLM inference latency and energy across prefill and decode phases, validated on NVIDIA H100 with under 5% error for LLaMA 3 8B.

0 favorites 0 likes
← Back to home

Submit Feedback