评估盲区:静默测量失败如何从训练到部署破坏AI系统

arXiv cs.LG 论文

摘要

本文介绍了“评估盲区”(evaluation blindness),这是一个用于描述从训练到部署过程中破坏AI系统的静默测量失败的正式框架,包含案例研究、基于50个真实事件验证的失败分类法,以及失败预算框架。

arXiv:2608.02786v1 公告类型:新 摘要:AI系统可能静默失败。这种失败会通过训练循环、评估流水线和生产监控栈传播,直到下游危害使其可见。本文提出“评估盲区”:当测量函数 M 相对于失败类别 F 表现出评估盲区时,它产生的读数与健康状态无法区分,而系统实际上正在失败,且没有辅助信号标记这一差距。 这个问题出现在文献中分别处理的两个生命周期阶段。在训练时,奖励模型被操纵,重要性采样校正被静默计算错误,基准污染虚高了微调评估,而同时损失曲线看起来健康,梯度更新正常进行。在部署时,监控未能捕获六类生产失败,其中“操作类”失败在结构定义上100%是静默的。 我们提供了一个统一的正式可检测性谓词,涵盖两个阶段。四个训练时案例研究追踪了具体的故障模式,包括TRL PR #6594中的一个真实实现缺陷,该缺陷在损失正常下降时破坏了梯度。一个基于法庭文件和监管文件中的50个真实事件验证的六类分类法发现,53%的可验证公开失败是静默的。失败预算框架将可接受的失败率与用例风险类别联系起来。 影响是直接的:测量基础设施是整个AI生命周期中的正确性问题,而不仅仅是评估时。数据、代码和分类法模式见 https://github.com/priyanka25aug/llm-failure-taxonomy。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:42

# 沉默的测量失败如何从训练到部署破坏AI系统 来源:https://arxiv.org/html/2608.02786

###### 摘要

AI系统可能悄然失败。一旦失败发生,它会在无人察觉的情况下传播——穿过训练循环、评估流水线和生产监控栈——直到下游危害使其显形。我们将**评估盲区**(evaluation blindness)识别为这种失败模式的统一结构性属性:若测量函数M相对于故障类别F表现出评估盲区,则当系统发生故障时,M产生的值与正常状态不可区分,且没有辅助信号标记该差异。评估盲区在生命周期的两个不同阶段显现,而文献一直将这两个阶段分开处理。在**训练时**,它表现为奖励模型被博弈、重要性采样校正被静默计算错误,或者基准污染虚增了微调评估——所有这些情况中,梯度信号和损失曲线看起来健康,而训练出的策略正在被破坏。在**部署时**,它表现为评估框架未能检测我们分类的六类生产故障:模型漂移、基础设施、集成、评估、安全与合规、运营——其中最后一类根据其结构性定义是100%静默的。我们做出四项贡献。第一,给出了评估盲区的形式化定义,带有一个可检测性谓词,将训练时和部署时的测量失败统一在单一框架下。第二,提供了四个有据可查的训练时案例研究——包括一个广泛使用的开源RL训练库(TRL PR #6594)中的具体实现错误——其中损失正常下降而梯度被破坏。第三,提出了一个六类系统级故障分类体系,基于50起来自法庭文件、监管文件和公开事后分析的真实生产事故进行验证,发现53%的可核实公开事故是静默的。第四,提出了一个按用例划分的故障预算框架,按风险类别(决策关键型、面向客户型、内部效率型、实验型)形式化可接受的故障率。这一统一框架有一个直接的工程含义:测量基础设施在AI系统生命周期的每个阶段都是正确性关注点,而不仅仅是在模型评估时。所有数据、代码和分类体系模式发布在 https://github.com/priyanka25aug/llm-failure-taxonomy。

## 1 引言

### 1.1 三场AI灾难的共同线索

2023年,纽约一名律师提交了一份法律简报,引用了六个不存在的案例,全部由ChatGPT生成。制裁意见在*Mata v. Avianca*(美国纽约南区联邦地区法院,2023年(https://arxiv.org/html/2608.02786#bib.bib23))中记录了该损害。但较少被注意到的是为什么这个失败没有被发现:律师的审查流程——即“此引用是否正确?”的测量函数——在真实案例名称与编造的案例名称之间没有产生任何区分信号。法律引文看起来*有效*。同年,加拿大航空公司运营的一个客服聊天机器人告诉一位悲痛欲绝的乘客,他可以追溯申请丧亲票价——而这一政策并不存在(不列颠哥伦比亚省民事调解法庭,2024年(https://arxiv.org/html/2608.02786#bib.bib24))。不列颠哥伦比亚省民事调解法庭裁定加拿大航空公司承担责任。出问题的不是模型准确性,而是系统的测量基础设施:没有任何组件在将聊天机器人的说法作为权威信息呈现给用户之前,对照实时政策数据库进行验证。输出通过了集成流水线中的每一项隐式质量检查。

英国邮政局Horizon系统(Horizon IT调查,2024年(https://arxiv.org/html/2608.02786#bib.bib25))自1999年起运行,产生的账目差异导致700多名邮政分局局长被错误起诉。账目输出被记录、审计并据此采取行动——但审计功能本身已损坏。测量基础设施将系统输出视为真实值,因此失败在多年间未被察觉地传播。

这三起事件都是AI系统故障。它们都具有相同的结构性属性:本应捕捉失败的测量函数产生了一个与正常状态不可区分的值。没有警报触发,没有质量指标下降。失败对可观测性基础设施不可见,直到下游危害使其显形。我们称之为**评估盲区**。

### 1.2 训练时和部署时的评估盲区

同样的结构性属性出现在AI生命周期的更早阶段——模型训练期间,而它在那里在很大程度上未被认识到。考虑一个基于人类反馈的强化学习(RLHF)训练运行,其中奖励模型被博弈:策略学会了在代理奖励上得分很高,而在实际用户效用标准上退化(Gao et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib42); Stiennon et al., 2020 (https://arxiv.org/html/2608.02786#bib.bib45))。训练损失正常下降,奖励曲线看起来很健康,没有梯度错误触发。本会*检测到*质量退化的评估基础设施——黄金标准人类偏好评估——没有随训练联机运行。失败直到部署后的质量审查才可见。

一个更具体的实例:在Hugging Face TRL库(Hugging Face TRL Contributors, 2024 (https://arxiv.org/html/2608.02786#bib.bib43))的Group Relative Policy Optimisation(GRPO)实现中,重要性采样比率校正中一个单行计算错误导致在KL散度偏差校正期间,每个token的比率被一个序列均值静默替换。训练损失下降了。策略在评估指标上看似有所改善。梯度计算在受影响运行的整个持续时间内都是错误的,而该错误仅在一位贡献者将TRL实现与DeepSeek-V3规范(Shao et al., 2024 (https://arxiv.org/html/2608.02786#bib.bib48))进行比较后才浮出水面。这是一个训练时评估盲区事件:测量函数(训练损失和奖励曲线)产生了与正确训练一致的数值,而梯度已被破坏。

文献将训练时失败(Gao et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib42))和部署时静默失败(Shen et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib38); Kumar et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib39); Liu et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib40))作为独立的研究方向。我们认为它们是同一问题在不同生命周期阶段的表现,而一个统一框架能够消除这种人为分离。

### 1.3 现有框架中的空白

Sculley等人(Sculley et al., 2015 (https://arxiv.org/html/2608.02786#bib.bib1))识别了ML系统中的隐藏技术债务——纠缠、反馈循环、未声明的消费者——但早于现代LLM部署。Amershi等人(Amershi et al., 2019 (https://arxiv.org/html/2608.02786#bib.bib2))处理了ML工程过程失败,但没有捕捉LLM特定的模式。Paleyes等人(Paleyes et al., 2022 (https://arxiv.org/html/2608.02786#bib.bib3))综述了前LLM部署挑战。LLM特定的工作聚焦于模型层现象:幻觉综述(Ji et al., 2023 (https://arxiv.org/html/2608.02786#bib.bib5); Huang et al., 2023 (https://arxiv.org/html/2608.02786#bib.bib6))、对抗性输入(Wei et al., 2023 (https://arxiv.org/html/2608.02786#bib.bib7); Perez and Ribeiro, 2022 (https://arxiv.org/html/2608.02786#bib.bib8); Greshake et al., 2023 (https://arxiv.org/html/2608.02786#bib.bib10))和对齐失败(Bai et al., 2022 (https://arxiv.org/html/2608.02786#bib.bib9))。最近的工作开始编目部署时静默失败(Shen et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib38); Kumar et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib39); Liu et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib40); Pandey, 2026 (https://arxiv.org/html/2608.02786#bib.bib41)),而另一条独立的工作线处理训练时奖励破坏(Gao et al., 2025 (https://arxiv.org/html/2608.02786#bib.bib42))。没有先前工作 (a) 提供共同结构性属性的形式化定义,(b) 将训练时和部署时的测量失败统一到单一框架下,或 (c) 引入一个与监管实践校准的正式可接受失败率模型。

### 1.4 贡献

本文做出四项贡献:

1. **评估盲区的一个形式化定义**——这是一种适用于训练时和部署时的测量函数结构性属性——带有一个可检测性谓词和生命周期阶段划分。
2. **四个有据可查的训练时评估盲区案例研究**,包括GRPO重要性采样错误(TRL PR #6594)作为一个具体、可验证的实例,其中训练运行产生看似合理的指标而梯度已被破坏。
3. **一个六类系统级故障分类体系**,带有子类别、可检测性剖面和爆炸半径刻画,并基于来自可验证公开来源(法庭文件、监管文件、学术论文、事后分析)的50起真实生产事故进行验证。
4. **一个按用例划分的故障预算框架**,按风险类别形式化可接受的故障率,并提供一个用于计算生产环境中故障预算利用率的参考实现。

第2节(https://arxiv.org/html/2608.02786#S2)形式化定义评估盲区。第3节(https://arxiv.org/html/2608.02786#S3)回顾相关工作。第4节(https://arxiv.org/html/2608.02786#S4)介绍分类体系。第5节(https://arxiv.org/html/2608.02786#S5)定义六类故障。第6节(https://arxiv.org/html/2608.02786#S6)记录训练时评估盲区。第7节(https://arxiv.org/html/2608.02786#S7)提出故障预算框架。第8节(https://arxiv.org/html/2608.02786#S8)描述数据集构建和验证。第9节(https://arxiv.org/html/2608.02786#S9)和第10节(https://arxiv.org/html/2608.02786#S10)讨论影响和开放问题。

## 2 评估盲区:形式化定义

### 2.1 结构性属性

广泛范围的AI系统故障共享一种结构性属性,它不同于可观察的症状(错误输出、质量下降、违反策略),也不同于根本原因(数据漂移、奖励黑客、缺少操作手册)。这种共同属性是:*本应检测失败的测量函数产生了一个与正常状态一致的数值*。

###### 定义1(评估盲区)。设S是状态空间\(\mathcal{S}\)中的AI系统,并设\(M:\mathcal{S}\to\mathbb{R}^{k}\)是一个测量函数(损失函数、评估指标、监控信号或其组合),其正常参考分布为\(\mathcal{D}_{\text{ok}}\)。系统状态\(s\in\mathcal{S}\)属于故障类别F,且相对于M表现出评估盲区,当且仅当:
\[
M(s)\overset{d}{\approx}\mathcal{D}_{\text{ok}}\quad\text{且}\quad\nexists\;\text{辅助信号}\;\hat{M}\;\text{使得}\;\hat{M}(s)\notin\mathcal{D}^{\hat{M}}_{\text{ok}}
\]
其中\(\overset{d}{\approx}\)表示在容差\(\varepsilon\)内的分布不可区分性,\(\mathcal{D}^{\hat{M}}_{\text{ok}}\)是\(\hat{M}\)的参考分布。非正式地说:系统正在失败,且*当前部署的*集合\(\mathcal{M}\)中没有测量能检测到它。

###### 定义2(结构性 vs. 偶然性评估盲区)。设\(\mathcal{M}^{*}\)表示在系统可观察信号下所有*结构上可用*的测量函数的集合。若\(\delta(s,\mathcal{M}^{*})=0\),则评估盲区是**结构性的**:可用信号的任何函数都无法将s与\(\mathcal{D}_{\text{ok}}\)区分开来。若\(\delta(s,\mathcal{M})=0\)但\(\delta(s,\mathcal{M}^{*})=1\),则是**偶然性的**:该失败*在原则上是可检测的*,但所需的测量尚未部署。

这一区分有直接的修复含义。结构性评估盲区需要一种*不同模态*的测量(例如,一种尚不存在于可部署系统信号中的黄金标签人类偏好评估);偶然性评估盲区需要部署一个已知但缺失的监控器(例如,从未配置的输出PII正则表达式)。我们数据集中的大多数C4、C1和C3部署时故障是偶然性的;GRPO IS比率错误(第6节(https://arxiv.org/html/2608.02786#S6))是结构性的——在未进行外部规范比较的情况下,任何训练时测量都无法标记梯度破坏。

### 2.2 可检测性谓词

我们定义一个二元**可检测性谓词**\(\delta(s,\mathcal{M})\),其中\(\mathcal{M}=\{M_{1},\ldots,M_{n}\}\)是所有已部署测量函数的集合:
\[
\delta(s,\mathcal{M})=
\begin{cases}
1 & \text{如果 }\exists\,M_{i}\in\mathcal{M}\text{ 使得 }M_{i}(s)\notin\mathcal{D}^{M_{i}}_{\text{ok}}\\
0 & \text{否则}
\end{cases}
\]
若对于当前测量集合有\(\delta(s,\mathcal{M})=0\),则故障是**评估盲的**。在静态\(\mathcal{M}\)下,平均检测时间(MTTD)是无限的;在实践中,故障会在\(\mathcal{M}\)被扩充(新增监控器)、下游危害在\(\mathcal{M}\)之外产生可观察信号、或人工审计直接审查输出时浮出水面。

### 2.3 生命周期阶段划分

评估盲区发生在AI系统生命周期的两个不同阶段:

##### 训练时评估盲区。
测量集合\(\mathcal{M}\)由训练损失、奖励曲线和留出基准评估组成。若一个失败状态s表现为损失正常下降、奖励看起来健康、基准分数稳定,而被训练的模型正在被破坏,则s是训练盲的。根本原因包括:奖励模型博弈、重要性采样计算错误、基准污染和策略优化中的模式坍缩。第6节(https://arxiv.org/html/2608.02786#S6)记录了四个具体实例。

##### 部署时评估盲区。
测量集合\(\mathcal{M}\)由生产监控(错误率、延迟、告警)和评估流水线(离线基准、LLM即评判器评分器)组成。若失败状态s的生产监控和评估流水线均未能标记该失败,则s是部署盲的。在我们的实证数据集中,36起可核实的公开生产事故中有53%是部署时评估盲的(包括合成复合案例在内的全部50起中为52%)。C4评估故障类别根据定义是100%盲的(测量基础设施本身就是故障组件)。

##### 统一推论。
两个生命周期阶段共享同一条工程处方:测量基础设施必须被视为头等正确性关注点。向\(\mathcal{M}\)添加传感器——无论是训练时(在RLHF中内联黄金标签偏好评估)还是部署时(分布监控、引用验证)——都是修复路径。第6节(https://arxiv.org/html/2608.02786#S6)和第五节中的分类体系(https://arxiv.org/html/2608.02786#S5)提供了一个结构化的清单,说明每个阶段\(\mathcal{M}\)必须包含什么才能对每个故障类别实现\(\delta=1\)。

相似文章

AI系统常以测试中不显现的方式失败?

Reddit r/AI_Agents

讨论AI工作流中干净的基准测试环境与混乱的真实世界使用之间的常见差距,导致生产环境失败,并提及评估平台如Confident AI、Braintrust和Langfuse。

我在AI项目中经常看到但没人公开讨论的事情

Reddit r/AI_Agents

本文指出,许多AI代理项目在生产环境中失败,并非因为模型质量,而是因为团队在发布前没有明确定义何为失败,忽略了关键边缘案例,导致自信地输出错误结果。