超越能力基准:从生产事故元数据学习LLM云服务的运行指纹
摘要
本文介绍了OpEmbed,这是一个从生产事故元数据学习LLM云服务运行指纹的框架,旨在增强云环境中的运行预测和可靠性管理。
arXiv:2608.26332v1 公告类型:新
摘要:托管的LLM服务现在已成为真实生产系统的一部分,但模型选择和服务规划仍然严重依赖能力基准,这些基准在部署后对运行行为的揭示甚少。我们介绍了操作嵌入(OpEmbed),这是一个从结构化、隐私保护的支持案例元数据中学习LLM云服务紧凑运行指纹的框架,无需使用案例文本。OpEmbed将模型-时间窗口聚合成一个八通道的运行签名,并通过时序对比学习、跨视图重建和世代序正则化来学习低维表示。在Google Cloud上超过33,000个生产支持案例的评估中,这些案例涵盖七个LLM家族,历时26个月,OpEmbed恢复了可解释的家族和版本级结构,改进了留一模型外的运行预测,优于非学习基线,在有限的早期窗口数据下仍然有用,并支持跨模型故障类型转移。我们报告了构建和评估此工具的经验教训,用于模型入职、支持准备评估和运行监控。
查看缓存全文
缓存时间: 2026/08/28 09:38
# 超越能力基准:从生产故障元数据学习LLM云服务的操作指纹 来源:https://arxiv.org/html/2608.26332 张梅伟,爱德华多·米兰达,布鲁斯·贝恩斯,苏维贾·贾恩,陈万龙,何涛,谢尔盖·博罗达夫金\* 隶属机构:谷歌云平台,谷歌有限责任公司(爱尔兰,加拿大,瑞士) \*通讯作者:[email protected] ###### 摘要 托管型LLM服务现已成为真实生产系统的一部分,但模型选择与服务规划仍严重依赖能力基准,这些基准在部署后的行为表现方面揭示甚少。我们提出操作嵌入(OpEmbed)框架,该框架通过结构化、隐私保护的支持案例元数据(无需使用案例文本)学习LLM云服务的紧凑操作指纹。OpEmbed将模型-时间窗口聚合为八通道操作签名,并通过时序对比学习、跨视图重构与世代序数正则化学习低维表示。在谷歌云上超过33,000个生产支持案例(涵盖7个LLM系列、26个月跨度)的评估中,OpEmbed能够恢复可解释的系列与版本级结构,在留一模型操作预测任务中优于非学习基线,在有限早期窗口数据下仍保持实用性,并支持跨模型故障类型迁移。本文汇报了构建和评估该工具在模型导入、支持就绪评估及操作监控方面的实践经验教训。 ###### 索引词: 软件可靠性工程,大语言模型,表示学习 作者说明:本文经同行评审并被IEEE国际软件可靠性工程研讨会(ISSRE)2026年工业轨道收录。后因公司差旅政策限制需现场汇报,严格遵循政策要求,已从官方会议论文集中撤稿。我们提供了完整的同行评审意见及录用通知以证明其同行评审状态(见附录)。 ## I 引言 大语言模型(LLMs)在企业环境中日益作为托管云服务进行部署\[1 (https://arxiv.org/html/2608.26332#bib.bib16),2 (https://arxiv.org/html/2608.26332#bib.bib17)\]。可靠运营此类服务不仅关乎模型能力,更涉及服务上线后的行为表现:哪些模型产生更多支持负载?哪些故障类型反复出现?问题解决速度如何?这些模式在不同版本间如何变化?这些正是平台与可靠性团队在模型导入、事件分级、支持人员配置及上线准备时需要解答的问题——而这些问题恰恰是能力排行榜无法回答的。 一个具体场景可以凸显这一差距。假设某平台团队需决定将两个新发布模型中的哪一个设为面向客户产品的默认选项。两者在公开推理和编码基准上的得分相差无几,因此能力评估无法提供决策依据。上线三个月后,发现其中一个模型产生的支持案例量约为另一个的两倍,且其中需升级至工程团队处理的比例远高于由一线支持解决的比例。基准排行榜从未预见到这种情况,但这直接决定了人力配置需求、导入风险和客户体验。正是这种操作可靠性缺口推动了我们的工作:我们希望利用运行服务时已采集的副产物信号来预测和监控此类差异。 我们认为,结构化支持案例元数据(优先级、故障类别、时间戳、升级模式、路由行为和响应时间统计)已能描述模型的操作概况\[3 (https://arxiv.org/html/2608.26332#bib.bib20)\],无需访问案例文本或客户内容\[4 (https://arxiv.org/html/2608.26332#bib.bib19)\]。基于此观察,我们提出操作嵌入(OpEmbed),如图1所示 (https://arxiv.org/html/2608.26332#S1.F1),该框架通过聚合模型-时间窗口学习LLM云服务的紧凑操作指纹。 我们的贡献包括:(1) 将LLM操作画像表述为基于结构化故障元数据的表示学习问题,定义了涵盖75个特征的八个信号通道;(2) 将时序对比学习、跨视图重构与世代序数约束结合为单一训练目标,并在生产数据评估中报告此组合目标的结果,将各目标的对照消融分解留待后续工作;(3) 在超过33,000个生产支持案例(涵盖7个LLM系列、26个月跨度)上评估该框架;(4) 展示所学表示支持留一模型预测、有限历史预测及跨模型故障迁移,且操作相似性并不总遵循供应商边界。从可靠性工程角度,这为模型导入和支持就绪规划提供了实用的、工具支持的替代方案,以取代基于供应商或系列的临时性启发式方法。 参见图片说明 图1:OpEmbed空间框架。 ## II 相关工作 LLM评估由能力基准主导,如MMLU\[5 (https://arxiv.org/html/2608.26332#bib.bib1)\]、HumanEval\[6 (https://arxiv.org/html/2608.26332#bib.bib2)\]、HELM\[7 (https://arxiv.org/html/2608.26332#bib.bib3)\],以及更动态的后续基准如MMLU-Pro\[8 (https://arxiv.org/html/2608.26332#bib.bib4)\]、Chatbot Arena\[9 (https://arxiv.org/html/2608.26332#bib.bib18)\]和LiveBench\[10 (https://arxiv.org/html/2608.26332#bib.bib5)\]。相关文献综述指出,可复现性、鲁棒性和现实世界有效性仍是未解挑战\[11 (https://arxiv.org/html/2608.26332#bib.bib6),12 (https://arxiv.org/html/2608.26332#bib.bib7)\],但这些基准主要量化能力,而非模型部署后的操作行为表现\[13 (https://arxiv.org/html/2608.26332#bib.bib21),14 (https://arxiv.org/html/2608.26332#bib.bib22)\]。 AIOps研究提供了最接近的方法学背景:告警处理、事件分析、异常检测以及LLM辅助的根因诊断\[15 (https://arxiv.org/html/2608.26332#bib.bib8),16 (https://arxiv.org/html/2608.26332#bib.bib9),17 (https://arxiv.org/html/2608.26332#bib.bib10),18 (https://arxiv.org/html/2608.26332#bib.bib11),19 (https://arxiv.org/html/2608.26332#bib.bib12),20 (https://arxiv.org/html/2608.26332#bib.bib13)\]。这些方法通常使用日志或跟踪信息诊断单个事件,而客户支持研究通常分类或路由单个工单\[21 (https://arxiv.org/html/2608.26332#bib.bib15),22 (https://arxiv.org/html/2608.26332#bib.bib14),23 (https://arxiv.org/html/2608.26332#bib.bib23)\]。两种情况下,分析单元都是单个案例。而OpEmbed则在模型-时间窗口层面操作,仅使用结构化元数据,学习支持跨模型比较、少样本预测和故障模式迁移的指纹——这些能力正是案例级工具所不具备的。 ## III 方法 ### III-A 问题表述与直觉 我们的目标是获得模型在生产环境中行为的固定长度摘要,粒度为模型和时间窗口,可在模型间比较且随时间保持稳定。设$\mathcal{M}$为已部署LLM模型集合,$\mathcal{T}$为离散时间窗口(在我们的部署中为日历月份)。对于每个模型$m$和窗口$t$,我们观察支持案例的结构化记录——优先级、故障类别、时间戳、解决结果——但从不获取案例文本。我们将这些聚合为签名$\mathbf{S}_{m,t}$(第III-B节 (https://arxiv.org/html/2608.26332#S3.SS2)),并学习函数$f_{\theta}\colon\mathbb{R}^{D}\to\mathbb{R}^{d}$,生成嵌入$\mathbf{z}_{m,t}=f_{\theta}(\mathbf{S}_{m,t})$。直观上,$\mathbf{z}_{m,t}$是“操作行为空间”中的坐标:坐标相近的两个模型预期施加相似的支持负担,即使跨越不同供应商;而单个模型的坐标应平滑漂移,除非其部署发生实质性变更。我们训练$f_{\theta}$以满足时序平滑性、模型可区分性与世代序数性。 ### III-B 操作签名构建 对于每个模型-月份对,我们在八个通道上构建75维操作签名:故障谱、时序模式、严重性与客户构成、解决效率、交互动态、根本原因、缺陷路由与工作负载上下文。选择这些通道是为了匹配企业支持系统中常填充的结构化字段,使得该构建方法可在其他具有类似模式的生态系统中重用。对于稀疏字段(如根本原因),我们同时编码观测值与覆盖率,使缺失性本身成为操作信号的一部分。 ### III-C 数据增强 自然出现的模型-窗口对数量受限于模型数量与观测周期。为缓解过拟合,我们应用子采样增强:对每对,无放回抽取其80%的案例并重新计算签名,重复$K$次,这将有效训练规模扩大$K+1$倍,同时反映真实的采样不确定性\[24 (https://arxiv.org/html/2608.26332#bib.bib24)\]。 ### III-D 多目标嵌入学习 签名矩阵标准化后通过PCA\[25 (https://arxiv.org/html/2608.26332#bib.bib25)\]投影至低维中间空间,这改善了条件并为学习线性投影提供了热启动;行级$L_2$归一化将所有嵌入置于单位超球面上。我们将在第IV-B节 (https://arxiv.org/html/2608.26332#S4.SS2) 解释基线对比时回到此热启动的作用。 投影通过三个互补目标训练,组合为单一加权损失。时序对比学习将模型在窗口$t$的嵌入拉向其自身在窗口$t+1$的嵌入,同时推离在相同窗口观测到的不同供应商模型;将负样本限制在同一时间窗口可控制平台级季节效应,否则会混淆模型特定信号。跨视图重构将八个通道分为故障侧视图(通道1、2、3、6:何物故障、何时、严重程度及原因)和响应侧视图(通道4、5、7、8:问题解决速度、沟通动态、路由及工作负载上下文),训练嵌入使一个视图能从另一个线性重构;这将表示与支持生命周期的两侧而非仅更可见的故障侧绑定。世代序数性是弱监督信号,仅要求嵌入保持同一供应商内连续版本的相对顺序(例如,版本ii比版本kk更接近jj),无需精确的版本间距离,使版本演进轨迹可解释。对各项贡献的控制消融是我们在第VI节 (https://arxiv.org/html/2608.26332#S6) 讨论的待办事项。 ### III-E 实验设置 数据集包含超过33,000个生产支持案例,涵盖7个LLM系列、26个月跨度,聚合为每个模型、每月签名。我们将OpEmbed与三个共享相同底层信号的非学习参考点进行比较:*全局平均*基线、*同系列平均*基线和*原始签名KNN*基线(直接在标准化75维签名上运行K-NN\[26 (https://arxiv.org/html/2608.26332#bib.bib26)\],无任何学习投影)。前两者检验OpEmbed是否优于平台团队非正式使用的简单启发式方法;后者检验其是否优于原始特征本身(保持输入信息固定)。 任务1:少样本操作预测。留一模型评估:被留出模型的指标通过嵌入空间中剩余模型的距离加权K-NN预测,通过六个目标(缺陷率、升级率、咨询率、初始响应时间中位数、转移反弹率、沟通强度)的MAE以及预测值-实际值图的$R^2$衡量。 任务2:跨模型故障迁移。我们通过其他模型的KNN预测每个模型窗口的故障类型分布,通过Jensen–Shannon散度(JSD)和Top-K命中率(预测Top-K与实际Top-3故障类型的重叠)评分。 ### III-F 工业部署与经验教训 OpEmbed设计为LLM服务可靠性审查的离线决策支持层,而非支持或SRE判断的自动化替代方案。在我们的工业环境中,结构化支持元数据定期聚合成模型-月签名并映射到操作嵌入空间。由此产生的邻域用于支持四个面向从业者的工作流:新上线模型的早期工作负载特征分析、从行为相似模型检索故障排除手册、支持强度或升级概况正在变化的模型分级,以及将嵌入漂移作为服务行为结构性转变信号的监控。 构建该工具揭示了若干实践经验教训。首先,仅元数据信号通常足以进行有用的可靠性画像,这降低了隐私和保密风险,因为不需要案例文本和客户内容。其次,支持流量并非同质:常规配额相关请求可能占据大部分数量并抑制升级相关结果的方差,因此区分技术与行政工作负载很重要。第三,最有用的表示不一定是最清晰的视觉聚类,而是能改善诸如人力配置、导入就绪和故障模式检索等具体决策的那个。 ## IV 结果 ### IV-A 操作指纹形成结构化、可解释的几何形状 如图2所示 (https://arxiv.org/html/2608.26332#S4.F2),OpEmbed形成了结构化的潜在空间而非任意投影:谷歌模型占据相对集中的区域,Anthropic-Claude模型形成更密集的聚类,Meta-Llama模型占据独立的中间区域,多个版本线描绘出平滑的局部轨迹。这与对比和序数目标一致,这些目标使模型线的相邻版本在行为上相关,同时允许操作差异显现。我们将此可视化(t-SNE,主要为定性)解读为组织性和连续性的证据,结合以下下游结果则最具说服力。 参见图片说明 图2:OpEmbed图谱与版本演进轨迹。 ### IV-B OpEmbed改善留一模型操作预测 在所有六个目标上,OpEmbed的预测误差均低于所有三个非学习基线。与Raw sig KNN的比较最具信息量,因为该基线与OpEmbed共享完全相同的输入:因此任何差距都反映了在原始特征之上的附加信息。然而,我们注意到投影是基于标准化签名的PCA初始化的,而我们当前的基线不包括仅PCA投影的KNN作为中间参考点...
相似文章
通过证据校准的查询聚类捕捉LLM能力
本文介绍了ECC算法,该算法通过有限模型比较校准语义嵌入,根据潜在能力需求对查询进行聚类,将LLM能力排名质量相较于基线提高了超过17个百分点。
释放大型语言模型的潜力:实现实时、企业级部署的蓝图
这篇arXiv论文提出了一种统一的LLMOps架构,用于实时、企业级LLM部署,集成了数据摄入、持续学习、RAG和反馈循环。它引入了AIPO、STAR+FAR和SAGE等组件,以解决受监管行业中知识过时、幻觉和延迟-成本权衡的问题。
TraceLLM
TraceLLM 为生产环境中的 AI 应用带来 OpenTelemetry 风格的可观测性,支持对基于 LLM 的系统进行追踪和监控。
LLM的有效用例
本文分享了LLM在软件工程中的实际应用案例,包括通过RAG搜索客户对话、从日志中排查API故障以及内容精简。重点强调了效率提升和减少手动筛选工作。
基准并非铁板一块:面向LLM评估的样本级审计与编排
本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。