人工智能开发中的偏差常态化

arXiv cs.AI 论文

摘要

本文认为,开发 AI 系统的组织面临着结构性动态,这些动态在历史上曾先于重大技术灾难发生,表明当前的安全基础设施可能不足。

arXiv:2609.05749v1 公告类型:新 摘要:人工智能风险的研究主要集中在能力风险上:系统变得过于强大、过于自主或与人类价值观严重错位的危险。而对组织层面的关注则少得多——即构建这些系统的机构本身是否倾向于走向失败。本文认为它们确实如此。无论 AI 系统变得多么强大,构建它们的组织都面临着过去重大技术灾难之前相同的结构性动态。通过 Space Shuttle Challenger、Three Mile Island 事故和 Boeing 737 MAX 崩溃的案例研究,本文识别了每次故障前的共同结构性机制,并将其映射到当代 AI 发展上。研究结果表明,现有安全基础设施提供的保护可能不如表面看起来那样有效,因为组织可以完全合规地完成安全流程,却仍然导致灾难性后果。AI 发展的灾难前时期仍在进行;本文的目的是使这些动态在还能被干预时变得清晰可辨。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:41

# AI开发中的偏差常态化
来源:https://arxiv.org/html/2609.05749
###### 摘要

目前关于人工智能风险的研究主要集中在能力风险:即系统变得过于强大、过于自主或与人类价值观严重偏离的危险。然而,对组织层面的关注却少得多——即构建这些系统的机构本身是否更易趋向失败。本文认为确实如此。无论人工智能系统变得多么强大,构建它们的组织都面临着与过去重大技术灾难相同的结构性驱动因素。本文通过分析"挑战者号"航天飞机、三哩岛事故以及波音737 MAX空难三个案例研究,识别出导致每次失败的共同结构性机制,并将其映射到当代人工智能开发中。研究结果表明,现有的安全基础设施可能并未提供表面上看起来的那么多保护,因为组织可能在完全遵守安全流程的情况下,仍然产生灾难性后果。人工智能开发的灾前阶段仍在进行中;本文的目的在于,在这些动态趋势仍可被干预时,使其变得清晰可辨。

## 1 引言

对智能机器风险的担忧由来已久,从维多利亚时代的散文家到当代人工智能安全研究者,这种担忧已持续了一个半世纪,并自2022年11月GPT-3.5发布以来变得尤为紧迫。这些警告几乎完全集中在能力风险上,即系统变得过于强大、过于自主或难以控制而偏离人类价值观的危险。本文认为,无论人工智能系统变得多么强大,构建它们的组织可能在结构上就倾向于走向失败——这并非出于疏忽或恶意,而是源于历史上曾导致重大技术灾难的组织动态。

其含义在于,现有的人工智能安全基础设施——包括内部安全团队、红队演练、模型评估和负责任的扩展政策——并非表面上看起来的那样可靠,因为组织可能完成所有安全流程却*仍然*滑向失败,正是由于本文识别的这些动态通过相同流程运作。本文的论述结构如下:第2节(https://arxiv.org/html/2609.05749#S2)构建将组织结构与失败联系起来的理论框架。第3节(https://arxiv.org/html/2609.05749#S3)转向历史研究,分析三个技术灾难以提取每个案例共有的结构性模式。第4节(https://arxiv.org/html/2609.05749#S4)将这一模式映射到人工智能开发领域,展示相同动态在何处已经显现。第5节(https://arxiv.org/html/2609.05749#S5)以针对该模式所暴露问题的建议作结。第6节(https://arxiv.org/html/2609.05749#S6)探讨历史类比的局限性,第7节(https://arxiv.org/html/2609.05749#S7)概述实证扩展方向,第8节(https://arxiv.org/html/2609.05749#S8)为结论部分。

## 2 背景

默顿早在1936年就指出,任何有目的的社会行动系统都不可避免地产生与其目标相悖的意外后果。在此基础上,特纳将"预见失败"认定为大规模灾难的共同前兆,认为早期预警信号因关于危险及其规避的文化观念而被系统性忽视。休斯将这一见解扩展到大规模社会技术系统,展示了行动者、技术和组织的组合如何产生超出任何单一设计者意图的复杂性。佩罗从这一传统中得出了最尖锐的结论,认为在紧密耦合的复杂系统中,灾难性故障并非异常,而是系统架构内置的结构性必然。萨甘拓宽了框架,展示了更大制度背景下的政治压力和官僚利益如何以加剧这些动态的方式塑造组织单元的行为。沃恩综合并扩展了这一传统,以组织文化和社会结构为核心,不仅解释了失败如何发生,更解释了为何最接近失败的人们往往未能预见。德克尔增加了时间维度,描述了组织在持续竞争压力下如何逐渐滑向安全操作边界,每一次微小调适都使得下一次调适更容易被合理化。这些研究共同将灾难性失败的根源定位在商业和政治压力下组织的常规动态中。

从这一传统中衍生出本分析的核心框架。这一被称为**偏差常态化**的过程,描述的是组织通过渐进式偏移,使违反安全规范的做法因反复未引发灾难而被重新定义为正常——该概念源于对1986年"挑战者号"航天飞机灾难的开创性研究。这一框架的关键特征在于,偏差常态化不需要恶人。授权发射的工程师和经理们能力出众、经验丰富,他们真诚地相信发射是安全的。他们的信念是错误的,但它源自一个系统性地向他们提供支持该信念的信息和框架的组织环境。这与组织失败的"不道德计算器"模型形成对比——后者认为决策者有意识地权衡违反安全规范的成本与收益,并在收益超过成本时选择继续。偏差常态化并非源于此类个人计算,而是源于组织结构及其所维持的文化。

组织失败文献识别了四种在偏差常态化案例中稳定出现的机制:**生产压力**产生最小化安全流程所带来的摩擦的激励,逐渐将举证责任转移给主张谨慎的一方;**过往成功带来的虚假保证**将灾难未发生视为安全的证据,这是一种逻辑上无效但在组织层面具有说服力的推断;**结构性保密**描述组织结构本身如何通过劳动分工和层级报告的自然结果阻碍安全相关信息的流动;**独立监督的弱化**则表现为监管者与被监管行业之间的关系随时间推移变得不那么对抗、更趋向合作,从而削弱了监督应有的独立性价值。

这些机制对新兴技术的影响尤为显著,因为安全标准与部署同步发展,缺乏可资借鉴的运行经验积累。一项针对石油天然气、核能、航空、医疗保健和铁路行业的33项研究的系统性综述发现,在所有研究领域都存在这些动态的持续证据,表明它们属于在竞争压力下管理风险的组织结构特征。在成熟技术领域,规范是历经数十年、往往以先前事故为代价逐步建立的。而在新兴技术中,这一过程被缩短甚至完全缺失。技术在效果被理解之前最容易控制,但其效果直到广泛部署后才被理解。由于缺乏成熟标准可作参照,行业实践便成为基线。这正是人工智能开发当前所处的状态。

## 3 案例研究

案例选择基于其详实的记录。每个案例都是过去半个世纪中被最彻底调查的组织失败案例之一,而这种文档记录正是偏差常态化研究所必需的,也是完整组织通常会隐藏的。案例跨越不同行业和年代,每个案例突显不同的机制。它们展示了这些动态如何运作,而非它们最终导致失败的频率。

### 3.1 挑战者号发射决策(1986年)

1986年1月27日晚,莫顿·塞奥科尔公司的工程师与美国航空航天局管理人员进行了紧急电话会议。他们反对次日的发射,理由是预报气温低于冰点,担心固体火箭助推器的O型环密封件可能失效。他们的意见被否决。数小时后,"挑战者号"升空,飞行73秒后解体,七名宇航员全部遇难。

偏差常态化的概念正是直接源于对这场灾难的分析。在"挑战者号"发射前的数年间,工程师们已公开观察并记录了O型环的侵蚀,但每次未酿成灾难的飞行都被事后解读为安全状况的确认。随着时间的推移,组织对这些证据的解释发生了转变。生产压力——由已多次推迟的发射计划所驱动——逐渐扭转了举证责任:以前飞行前必须确保安全,而现在主张谨慎者必须证明发射不安全才能叫停。过往成功带来的虚假保证终结了争论。每次无事件的飞行都使下一次批准变得更容易。

### 3.2 三哩岛事故(1979年)

1979年3月28日三哩岛2号机组的部分熔毁事故,始于一个因多年微小异常累积而复杂化的反应堆系统中一个卡在开启位置的先导式泄压阀,这些异常均通过临时变通方案处理,这些方案逐渐固化为标准操作程序。总统委员会得出结论,灾难源于核管理委员会和核工业在处理反应堆安全方面的缺陷。组织环境已将通过即兴发挥管理复杂性的做法常态化,而这种常态化正是事故得以发生的条件。三哩岛事故最常通过正常事故理论来解读,即交互复杂性和紧密耦合的失败。本文的解读与之互补,因为事故前形成的非正式变通文化正是偏差常态化在运行环境中的表现。

在组织层面上,三哩岛案例突显了结构性保密和不透明性。反应堆系统因层层修改而变得日益复杂,控制室操作员无法实时形成对反应堆内部状况的准确心智模型。当泄压阀卡在开启位置时,一连串令人困惑且部分矛盾的指示读数意味着重大决策是基于对系统状态错误的理解做出的。操作员曾接受过处理预期异常情况的训练,而实际发生的异常组合完全超出了其训练范围。

操作员已养成以非正式方式处理常规异常的习惯,不进行系统性报告或分析,因为将每一次异常都视为潜在危机在组织上不可持续。非正式变通方案一直有效,直到失效。当事故发生时,正式操作规程与实际操作实践之间的差距已大到操作员缺乏程序性和认知性资源来正确认识和应对所发生的情况。安全相关信息存在于系统中,只是从未传递给有权也有知识采取行动的人。

### 3.3 波音737 MAX空难(2018-2019年)

2018年10月狮航610航班和2019年3月埃塞俄比亚航空302航班的坠机,是由名为MCAS(机动特性增强系统)的软件系统引发,该系统根据错误的传感器数据反复将飞机机头下推。MCAS的设计是为了补偿因在未设计容纳更大发动机的机身上安装更大发动机而产生的气动操控差异。它是针对物理设计缺陷的一个软件补丁,两架航班的飞行员都未能在撞击前接管系统。

这一设计路径的起源在于竞争压力。当空客宣布A320neo时,波音面临选择:设计新飞机还是改装现有的737平台。改装更快且成本更低,并可使该飞机作为现有737的变体而非全新飞机获得认证,从而避免为客户航空公司带来昂贵的模拟器培训要求。波音选择了改装,并走上了一条一系列工程妥协变得越来越难以逆转的道路。MCAS最初是一个次要系统,仅设计用于在罕见的高攻角情况下(机头陡峭上扬)介入。在开发过程中,其权限被扩大,并被设计为仅依赖单个攻角传感器的输入,使其易受单点故障影响。每一次改变都伴随着评估......

相似文章

AI安全与对齐

Reddit r/artificial

文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。

关于渐进式失权的问题

Reddit r/ArtificialInteligence

作者研究现有社会退化和制度衰败是否是加速AI依赖的先决条件,而不仅仅是结果,引用了AI安全研究和认知与制度方面的外部研究。

为什么负责任的AI开发需要在安全问题上进行合作

OpenAI Blog

OpenAI发布了一份政策研究论文,确定了四项战略来改进行业在AI安全规范方面的合作:传达风险/收益、技术协作、提高透明度和激励标准。该分析论述了竞争压力如何可能导致对安全性的投资不足,并提出了协调激励措施以促进安全AI开发的机制。