workload-analysis

Tag

Cards List
#workload-analysis

A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

arXiv cs.AI · 2026-08-17 Cached

This paper analyzes a one-year production trace from Chutes to study LLM serving workloads, revealing temporal evolution and user-model interactions to improve serving system benchmarking.

0 favorites 0 likes
← Back to home

Submit Feedback