LLM服务的一年:负载演化、缓存与负载均衡
摘要
本文分析了来自Chutes的一年生产追踪数据,以研究LLM服务负载,揭示时间演化和用户-模型交互,以改进服务系统基准测试。
arXiv:2608.13573v1 公告类型:新
摘要:大语言模型(LLM)服务已成为关键的云工作负载,真实的追踪数据对于推动和基准测试服务系统至关重要。然而,现有的LLM服务负载研究在规模和范围上仍然有限。它们通常观察短时间段,并且对用户在生产中如何与模型交互提供有限的可见性。因此,它们未能完全捕捉LLM服务负载如何随时间演化或用户-模型交互如何塑造生产流量。
在这项工作中,我们通过对来自Chutes的一年生产追踪数据进行全局表征和纵向研究,进一步理解现实世界的LLM服务负载。与之前的研究不同,我们的追踪捕获了跨多个模型和用户的完整生产行为,包括流行和长尾模型。我们从聚合、时间、模型级和用户级视角分析负载,揭示通常隐藏在聚合视图背后的负载演化和用户-模型结构。为了支持未来研究,我们将随论文发布完整的一年追踪数据,使下游研究能够研究生产行为,而无需依赖采样或合成生成的工作负载。
查看缓存全文
缓存时间: 2026/08/17 09:37
# 大语言模型服务的一年演进:负载变化、缓存与负载均衡 来源:https://arxiv.org/abs/2608.13573 查看PDF (https://arxiv.org/pdf/2608.13573) > 摘要:大语言模型(LLM)服务已成为关键的云工作负载,而真实的跟踪数据对于驱动和评测服务系统至关重要。然而,现有的LLM服务负载研究在规模和范围上仍然有限。它们通常观察的时间段较短,且对用户如何在生产环境中与模型交互的可见性有限。因此,它们未能完全捕捉LLM服务负载如何随时间演进,或用户与模型的交互如何影响生产流量。本工作通过全球特征分析和对来自Chutes的一年期生产跟踪数据的纵向研究,进一步深化了对现实世界LLM服务负载的理解。与先前研究不同,我们的跟踪数据捕获了跨众多模型和用户的完整生产行为,包括热门模型和长尾模型。我们从聚合、时间、模型层面和用户层面分析了负载,揭示了通常隐藏在聚合视图背后的工作负载演进和用户-模型结构。为支持未来研究,我们将随论文发布完整的一年期跟踪数据,使后续研究能够直接研究生产行为,无需依赖采样或合成生成的工作负载。 ## 提交历史 来自:William Nixon \[查看邮件 (https://arxiv.org/show-email/aeda041d/2608.13573)\] **\[v1\]** 2026年7月3日(星期五)17:45:43 UTC(3,765 KB)
相似文章
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…
本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。
我们不再手动优化 LLM 技术栈——现在它实现了自我优化
本文描述了一家企业如何实现向自我优化 LLM 技术栈的转型。该系统利用生产环境中的调用追踪数据,自动路由请求并微调模型,从而显著降低了成本并提升了性能。
@Mayhem4Markets: https://x.com/Mayhem4Markets/status/2069090022117019928
两大主流LLM服务框架SGLang和vLLM的详细技术对比,涵盖KV缓存管理(RadixAttention vs PagedAttention)的架构差异、吞吐量、延迟以及自托管环境的部署考量。
您的LLM推理基准测试在误导您
本文解释了为何LLM推理的合成基准测试可能具有误导性,因为生产流量具有突发性和可变性,并建议使用真实工作负载进行测试以选择正确的推理框架。