LLM服务的一年:负载演化、缓存与负载均衡

arXiv cs.AI 论文

摘要

本文分析了来自Chutes的一年生产追踪数据,以研究LLM服务负载,揭示时间演化和用户-模型交互,以改进服务系统基准测试。

arXiv:2608.13573v1 公告类型:新 摘要:大语言模型(LLM)服务已成为关键的云工作负载,真实的追踪数据对于推动和基准测试服务系统至关重要。然而,现有的LLM服务负载研究在规模和范围上仍然有限。它们通常观察短时间段,并且对用户在生产中如何与模型交互提供有限的可见性。因此,它们未能完全捕捉LLM服务负载如何随时间演化或用户-模型交互如何塑造生产流量。 在这项工作中,我们通过对来自Chutes的一年生产追踪数据进行全局表征和纵向研究,进一步理解现实世界的LLM服务负载。与之前的研究不同,我们的追踪捕获了跨多个模型和用户的完整生产行为,包括流行和长尾模型。我们从聚合、时间、模型级和用户级视角分析负载,揭示通常隐藏在聚合视图背后的负载演化和用户-模型结构。为了支持未来研究,我们将随论文发布完整的一年追踪数据,使下游研究能够研究生产行为,而无需依赖采样或合成生成的工作负载。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:37

# 大语言模型服务的一年演进:负载变化、缓存与负载均衡
来源:https://arxiv.org/abs/2608.13573
查看PDF (https://arxiv.org/pdf/2608.13573)

> 摘要:大语言模型(LLM)服务已成为关键的云工作负载,而真实的跟踪数据对于驱动和评测服务系统至关重要。然而,现有的LLM服务负载研究在规模和范围上仍然有限。它们通常观察的时间段较短,且对用户如何在生产环境中与模型交互的可见性有限。因此,它们未能完全捕捉LLM服务负载如何随时间演进,或用户与模型的交互如何影响生产流量。本工作通过全球特征分析和对来自Chutes的一年期生产跟踪数据的纵向研究,进一步深化了对现实世界LLM服务负载的理解。与先前研究不同,我们的跟踪数据捕获了跨众多模型和用户的完整生产行为,包括热门模型和长尾模型。我们从聚合、时间、模型层面和用户层面分析了负载,揭示了通常隐藏在聚合视图背后的工作负载演进和用户-模型结构。为支持未来研究,我们将随论文发布完整的一年期跟踪数据,使后续研究能够直接研究生产行为,无需依赖采样或合成生成的工作负载。

## 提交历史

来自:William Nixon \[查看邮件 (https://arxiv.org/show-email/aeda041d/2608.13573)\] **\[v1\]** 2026年7月3日(星期五)17:45:43 UTC(3,765 KB)

相似文章

您的LLM推理基准测试在误导您

Reddit r/artificial

本文解释了为何LLM推理的合成基准测试可能具有误导性,因为生产流量具有突发性和可变性,并建议使用真实工作负载进行测试以选择正确的推理框架。