云原生评估即服务:一种具有共形保证的可扩展AI监控的微服务架构
摘要
本文介绍了EaaS,一种云原生微服务架构,用于可扩展的AI监控,提供共形预测、校准评估、漂移检测和具有统计保证的公平性监控。
arXiv:2607.21623v1 Announce Type: new
Abstract: 我们提出了EaaS,一种云原生参考架构,将AI评估方法运作为六个无状态的Kubernetes微服务:具有有限样本校正自适应预测集的共形预测、校准评估、通过RFF近似最大均值差异的漂移检测、具有自助法置信区间的公平性监控、基于DAG的管道编排器以及结果存储API。我们验证了四个关键方法论问题。首先,经验覆盖率与边际共形保证一致,在K=50次随机校准/测试分割中,平均覆盖率在名义目标值的1.4个百分点以内。其次,所有四个MMLU答案token都出现在前20个logprobs中,无需插补,而模拟10%的插补产生的覆盖率影响小于1.5%。第三,RFF-MMD在中位启发式带宽下对中度和严重漂移实现了100%的检测能力,第一类错误在5-8.5%之间。第四,在UCI Adult Income数据集上的公平性监控揭示了种族间显著的人口统计平权差异(DP差距=0.33),并且在连续批次中警报稳定。共形预测和校准服务在批大小为100时实现了低于2ms的p99延迟;RFF-MMD需要约500ms,适合周期性批量监控。与四个开源工具的比较表明,据我们所知,当前没有平台能够同时提供共形预测即服务、微服务分解和基于DAG的编排。
查看缓存全文
缓存时间: 2026/07/27 07:39
# 面向可扩展AI监控的微服务架构:具备共形保证的云原生评估即服务 ###### 摘要 可信AI的部署需要超越初始基准测试的持续、严格评估,然而现有工具要么是不适合生产环境的离线框架,要么是缺乏可组合性和正式统计保证的专有系统。本文提出**EaaS**,一种云原生参考架构,它将数学上严谨的AI评估方法操作化为六个无状态Kubernetes微服务:具有有限样本校正自适应预测集(APS)的共形预测、校准评估、基于随机傅里叶特征近似最大均值差异(MMD)的漂移检测、具有自助法置信区间的公平性监控、基于DAG的管道编排器,以及结果存储API。我们通过针对性实验解决了四个方法论关键问题。首先,在K=50次随机校准/测试分割中,经验覆盖率与边际有限样本共形保证一致,平均覆盖率在名义目标的1.4个百分点以内,且Wilson 95%置信区间在所有α水平上都包含目标值。其次,top-20 logprob API在所有四个MMLU答案令牌上实现0%的插补需求,且模拟的10%令牌插补仅产生小于1.5%的覆盖率影响。第三,在中位启发式带宽下,RFF-MMD对轻微和严重漂移均实现100%的检测能力,第一类错误率在5–8.5%之间。第四,对UCI Adult Income数据集的公平性监控揭示了种族间显著的统计均等差距(DP差距=0.33),且在连续批次中警报稳定。在单进程基准测试中,当批大小为100时,共形预测和校准评估服务的p99延迟低于2毫秒;RFF-MMD需要约500毫秒,适用于周期性批次监控。与四个现有开源工具的系统性比较表明,据我们所知,目前没有平台能将共形预测即服务、微服务分解和基于DAG的编排结合起来。 ## 1 引言 部署AI模型并非终点,而是起点。一旦投入生产,模型面临静态基准无法捕捉的分布漂移、校准退化以及新出现的公平性违规问题。然而,可用于持续评估的工具分为两类,各有盲区:诸如HELM(Liang等人,2023)和TrustLLM(Sun等人,2024)等离线框架能进行丰富的评估,但从未为生产集成而设计;而像SageMaker(亚马逊云服务,2021)这类托管监控服务虽能大规模运作,但缺乏可组合性、正式的统计保证以及开源可扩展性。 **存在的差距。** 近期一项涵盖136项研究的多元文献综述发现,技术监控(漂移、性能)远比负责任的ML监控成熟,仅有3.5%的方法对公平性是模型无关的(Naveed等人,2025)。根据我们对26篇论文和7个现有工具的回顾,目前没有开源平台能将共形预测、多变量漂移检测、校准评估和公平性监控作为可组合的微服务,并在Kubernetes上通过基于DAG的编排统一起来。此外,现有的共形预测结果通常报告单次分割的覆盖率,而未量化跨校准抽取的变异性(Zwart,2025;Bian和Barber,2023),监控系统中的公平性评估则绝大多数依赖合成数据,而非带有受保护属性的真实数据集(Ding等人,2022)。 **我们的方法。** 我们设计、实现并经验验证了**EaaS**,这是一种云原生参考架构,将数学上严谨的评估方法操作化为六个无状态微服务:(i)带有有限样本校正APS分数的分割共形预测(Angelopoulos和Bates,2023),(ii)使用四个ECE估计量进行多变量校准评估(Kumar等人,2019;Guo等人,2017),(iii)结合逐特征Kolmogorov–Smirnov检验与Benjamini–Hochberg校正(Benjamini和Hochberg,1995)以及通过随机傅里叶特征近似MMD(Rahimi和Recht,2007)的漂移检测,(iv)具有自助法置信区间和最小样本保障的公平性监控,(v)具有重试、背压和幂等语义的轻量级DAG编排器,以及(vi)用于审计追踪和趋势分析的结果存储API。 **关键结果。** 在合成数据和真实的GPT-4o-mini MMLU logits(500个问题)上,EaaS实现了:(1)在K=50次随机分割中,共形覆盖率满足1−α保证,Wilson置信区间确认了鲁棒性(平均覆盖率在目标值的0.5%以内);(2)有界插补影响——所有四个MMLU答案令牌都出现在top-20 logprobs中,模拟的10%令牌插补仅使覆盖率降低1.3%;(3)在中位启发式带宽下,RFF-MMD对轻微和严重漂移实现100%的检测能力,所有带宽设置下的第一类错误率在5–8.5%之间;(4)对真实UCI Adult Income数据集的公平性监控揭示了种族间显著的统计均等差距(DP差距=0.33,自助法95% CI [0.28, 0.37]);(5)核心服务在批大小为100时p99延迟低于2毫秒,完整的五节点评估DAG执行时间为22毫秒。 **贡献。** 我们做出以下贡献: - • 据我们所知,我们设计了第一个开源微服务架构,将共形预测、校准评估、漂移检测和公平性监控作为可组合的Kubernetes服务,并具有DAG编排功能。 - • 我们在真实的GPT-4o-mini MMLU logits上,通过50次随机校准/测试分割并使用Wilson置信区间,验证了共形覆盖的鲁棒性,并量化了top-k logprob插补对覆盖保证的有界影响。 - • 我们进行了全面的RFF-MMD敏感性消融实验——扫描随机特征数量、核带宽和排列计数——展示了在广泛超参数范围内的良好校准的第一类错误率和高检测能力。 - • 我们使用UCI Adult Income数据集将公平性监控从合成数据扩展到真实数据,揭示了具有自助法置信区间和稳定顺序监控的有意义的差异。 本文的其余部分组织如下。第2节调研相关工作。第3节描述架构和方法论。第4节展示实验结果。第5节讨论启示和局限性。第6节总结。 ## 2 相关工作 我们将先前工作组织为**EaaS**整合的四条主线:评估框架、共形预测、漂移检测和云原生ML基础设施。 **整体AI评估。** HELM(Liang等人,2023)确立了多维评估范式,在42个场景中评估语言模型的准确性、校准、鲁棒性、公平性、偏差、毒性和效率。TrustLLM(Sun等人,2024)将其扩展到涵盖真实性、安全性和隐私的可信度基准。这两个框架都设计用于离线批量评估,无法直接与生产模型服务基础设施集成。**EaaS**采用了这些框架的多指标理念,同时将评估重新架构为适合持续监控的无状态微服务。 **共形预测。** Angelopoulos和Bates(2023)通过共形预测提供了分布自由不确定性量化的基础处理,建立了有限样本覆盖保证P(Y_test ∈ C(X_test)) ≥ 1-α,其中使用校正分位数q̂ = Quantile(s_1, ..., s_n; ⌈(n+1)(1-α)⌉/n)。自适应预测集(APS)评分函数通过累积排序后的softmax概率产生更紧的预测集。Zwart(2025)表明,在小样本情况下,无限测试覆盖率服从C ∼ Beta(k, n+1-k),并提出了小样本Beta校正以提供PAC风格保证。Bian和Barber(2023)建立了在算法稳定性下,分割共形何时提供基于特定校准分割的稳定覆盖率的条件。尽管理论已成熟,但据我们所知,现有的开源生产监控系统没有将共形预测实现为可部署的服务。Kumar等人(2023)使用softmax分数将标准分割共形应用于MMLU上的LLM,而Su等人(2024)为无法获得完整logits的仅API设置提出了LofreeCP。为了扩展到大型词汇表,Quach等人(2024)研究了将APS与语义掩码结合用于下一个令牌预测。**EaaS**将带有APS的分割共形预测操作化为一个无状态微服务,并且我们跨50次随机分割在真实的GPT-4o-mini logits上验证了覆盖率——而不仅仅是单次分割——证明了与Beta分布覆盖率理论一致的鲁棒性。 **漂移检测。** 通过最大均值差异(MMD)的基于核的漂移检测(Kalinke和Szabó,2022)为分布偏移提供了原则性的多变量检验。Viehmann(2021)将其扩展到部分MMD以处理不平衡分布。对于高维数据,精确MMD为O(n²D),这对于在生产环境中使用嵌入是不切实际的。随机傅里叶特征(Rahimi和Recht,2007)将核计算降低到O(nD·n_rff),使得能够在高维数据上进行近似MMD;其他可扩展的核近似方法如Nyström方法(Williams和Seeger,2000)提供了可比的复杂度,但需要存储地标点而非随机投影。Choi和Kim(2026)建立了基于RFF的MMD检验的理论基础,证明了在次平方时间下,最优随机特征数量可以达到最小最大分离率。Alibi Detect提供了MMD和Kolmogorov–Smirnov检验的库级别实现,但并未将它们部署为可扩展的服务。用于模型置信度分布上的顺序漂移检测的变化点模型(Ackerman等人,2020)补充了嵌入级别的方法。**EaaS**将单变量检验(KS/PSI)与Benjamini–Hochberg校正以及通过RFF的近似MMD结合起来,作为独立的、水平可扩展的微服务,并且我们在广泛的超参数扫描中验证了第一类错误率和检测能力。 **公平性监控。** Naveed等人(2025)的监控文献综述发现,负责任的ML监控仍然不成熟,只有3.5%的方法是模型无关的。Sheng等人(2024)通过虚拟令牌计数器调度器在服务时间处理公平性,以实现公平的资源分配。Ding等人(2022)批判性地审视了UCI Adult数据集,揭示了50K美元阈值总体上是第76百分位数,但对于黑人个体是第88百分位数,对于女性是第89百分位数,并提出了Folktables包作为替代方案。**EaaS**关注结果公平性——统计均等和均等化几率——使用自助法置信区间和最小样本保障,并且我们在真实的Adult Income数据上进行了验证,同时承认Ding等人(2022)指出的局限性。 **云原生ML基础设施。** MLOps范式(Kreuzberger等人,2023)定义了生产ML系统的原则,包括持续监控、工作流编排和可复现性。SuperSONIC(Kondratyev等人,2025)展示了使用Kubernetes、Triton和KEDA自动伸缩的云原生推理即服务。ElasticRec(Choi等人,2024)表明,推荐模型的微服务分解通过每个分片独立的Kubernetes HPA伸缩,实现了3.3×的内存减少和1.6×的成本降低。Ursa等人(2024)提供了一个在并发负载下基于延迟测量的微服务资源分配框架。**EaaS**将这种微服务分解原则应用于评估而非推理:每个评估方法作为一个具有自己伸缩策略的独立服务运行,通过一个轻量级DAG编排器(而非像Argo或Kubeflow这样的重型工作流引擎)进行组合。 **生产监控平台。** 像Arize和WhyLabs这样的商业平台提供生产ML监控,包括漂移检测、性能跟踪和仪表板,但它们是闭源的,并且不公开共形预测或可组合的评估DAG。亚马逊的Fortuna库(Detommaso等人,2023)提供不确定性量化,包括共形预测,但作为一个Python库,没有服务级别的部署或编排。**EaaS**与这些平台不同,它提供了一个开源、可组合的微服务架构,其中每个统计方法都是一个独立可部署和可伸缩的服务。 **定位。** 第4.9节中的表13提供了详细的功能比较。总之,在我们审查的开源工具中,我们未发现一个平台能将共形预测、多变量漂移检测、校准评估、公平性监控和基于DAG的编排作为独立可部署的微服务相结合。 ## 3 方法论 我们描述了**EaaS**架构(第3.1节)、每个服务的数学基础(第3.2节)、数据集(第3.3节)以及实验设计(第3.4节)。 ### 3.1 架构 **EaaS**由六个微
相似文章
我为AI开源了“AWS for AI”平台。一个Docker Compose即可为整个组织提供受治理、合规、可审计的AI。网关、护栏、策略、可观测性、审计等——全部互联,基于开源构建。
一个开源的Docker Compose配置,集成了多个开源工具(LiteLLM、LLM Guard、OpenBao、Langfuse等),为组织提供受治理、合规、可审计的AI平台,并附带用户友好的界面用于构建受治理的工作流。
实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。
@anyscalecompute:大多数 Agent 框架解决了编排问题,却在基础设施方面完全未予解决。最新博文:面向生产的 AI…
Anyscale 发布了一篇技术指南,介绍如何使用 Ray Serve、MCP 和 A2A 协议部署面向生产环境的 AI Agent。文章针对常见的底层基础设施瓶颈,提出了一种解耦的微服务架构,支持 LLM、工具与 Agent 的独立扩缩容。
构建AI代理时如何进行评估与可观测性?
作者探讨了在生产环境中评估和监控AI代理所面临的挑战,包括离线评估与在线评估、LLM作为评判、链路追踪和成本追踪,并提到Langfuse、LangSmith等工具,但更关注底层流程。
基于多专家共识机制的无服务器环境自动缩放方法
本文提出了一种面向无服务器环境的依赖感知自动缩放框架,集成了基于图的瓶颈识别、通过概率集成的多模型预测(MLP、LSTM、CNN)以及成本感知的缩放控制。实验表明,预测准确率达到99.88%,并降低了基础设施成本。