AI相关可靠性事件频发

Lobsters Hottest 新闻

摘要

本文探讨了使用AI代理处理运维任务(如值班工作)的兴起趋势,但警告其复杂性可能导致意外可靠性事件,并引用了安全会议上的近期演讲和案例。

<p><a href="https://lobste.rs/s/jzr2ey/wild_ai_related_reliability_incidents">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/23 19:22

# 即将出现的疯狂AI相关可靠性事件 来源:https://surfingcomplexity.blog/2026/08/22/wild-ai-related-reliability-incidents-are-coming/ 最近,有两条AI相关内容引起了我的注意。首先是Boris Tane的博客文章《值班现已沦为表演》(https://boristane.com/blog/on-call-is-now-theatre/)。他认为AI智能体现在有能力承担目前由人类完成的大部分值班工作,我们应该让AI智能体担任第一响应者。只有当AI智能体无法解决问题时,才应让人类介入,并且应该由智能体来呼叫人类。正如他所说: > 我们需要这样的软件:它能监控自身、对自身警报进行分类、调查自身事件、修复能修复的问题,只有遇到真正新颖的问题时才升级给人类,并且证据已经整理好。将你的AI智能体置于最糟糕的值班轮换中,然后给它们一个呼叫人类的工具。开发人员不再充当第一响应者,只有在智能体确实无法解决时才介入。 Tane认为企业不会真的开始让AI智能体值班(“大多数团队不会这么做”),但他认为这*应该*发生,并且他已基于此前提创立了一家公司(https://polylane.com/)。 我喜欢将AI智能体值班等同于使用AI智能体实施控制系统自动化。因为归根结底,运维工作就是如此:采取控制动作以使系统保持在健康状态。 如今,AI智能体是极其复杂的软件系统。我敢说它们是我们人类构建过的最复杂的软件系统。这种复杂性既有好处也有坏处。艾什比定律(https://surfingcomplexity.blog/2020/01/18/there-is-no-escape-from-ashbys-law/)告诉我们,你希望控制系统能处理的系统状态集越大,它就需要越复杂。正是这种复杂性使得理论上有可能将AI智能体应用于解决此类通用控制问题。 另一方面,系统越复杂,人类就越难推断其行为。当系统健康运行时这没问题,但如果你那个*现在更加*复杂的系统进入自动化无法处理的状态,那可能使问题变得更糟。事实上,正是复杂控制系统的意外行为(https://surfingcomplexity.blog/2017/06/24/a-conjecture-on-why-reliable-systems-fail/)导致了最严重的复杂系统故障(另见:法航447航班(https://surfingcomplexity.blog/2014/09/30/cloud-software-fragility-and-air-france-447/)、波音737 MAX事故(https://en.wikipedia.org/wiki/Maneuvering_Characteristics_Augmentation_System#Role_of_MCAS_in_accidents))。 这让我想到了最近看到的另一个内容:OpenAI在BlackHat大会上的演讲(https://www.youtube.com/watch?v=87DyyMV0kCY)(由David Blank-Edelman (https://www.linkedin.com/in/dnblankedelman/) 推荐)。是的,这是一个37分钟的演讲(https://theonion.com/friend-who-sent-link-to-8-minute-youtube-video-must-be-1819574977/),但我建议你观看一下。 该演讲详细介绍了AI智能体在OpenAI和Hugging Face引发安全事件的令人惊讶的行为。老实说,这个演讲感觉像是出自关于技术失控的电影;那种对我来说仍然绝对是科幻小说的情节。 因为这是在安全会议上做的演讲,演讲者侧重于适用于安全领域的教训。但作为一个关注可靠性的人,我从这个演讲中得到的最重要收获是:***自主的大语言模型智能体可能表现出人类从未预料到的行为***。虽然当今的智能体可以执行复杂的认知任务,但它们的行为方式与执行该任务的人类不同。当它们犯下与人类不同的错误时,我们最为熟悉这一点。在OpenAI-HuggingFace事件中,与其说它们犯了错误,不如说智能体追求目标的方式与人类不同。如果你的队友使用零日漏洞来绕过内部安全协议以完成工作,你会说他们行为*不合理*。而这正是风险所在。 前沿模型的必然改进并不意味着智能体的行为会更容易理解;我实际上认为恰恰相反。随着模型变得更先进,智能体的行为将变得更加复杂,但这并不意味着它会变得更像人类。人类非常复杂,但我们知道如何推断人类行为;至少,对我们一起工作的人是这样。毕竟,一个行为不可预测的员工在组织中不会长久。随着这些智能体变得更有能力,它们将类似于异类的智能:是智慧,但非我们所知的那种。 我认为事情会这样发展:我认为一些团队会采纳Tane的建议,使用AI智能体作为第一响应者来处理运维问题。我认为在很多情况下,智能体将能成功修复问题。当然,为了让智能体真正能够修复问题,它们需要获得无需人类干预即可采取运维操作的权限。 然而,终有一天,会出现智能体无法处理的复杂事件。Tane认为,在这种情况下,智能体会通过呼叫人类来向人类求助。但这不是我担心的情景。我担心的是,智能体会尝试修复,并且它们的尝试会让情况变得更糟。只有在这些修复尝试失败之后,人类才会介入。也许它们最终会呼叫人类,或者当智能体持续尝试修复失败时,人类会注意到出了严重问题。但现在,人类必须理解这个软件-AI-智能体组合系统的行为。原始问题已经如此复杂以至于智能体无法处理,而它们现在又因为尝试修复而使其恶化。我甚至能想象人类与那些持续尝试采取修复动作但失败的智能体对抗的场景。 这就是即将到来的事件。当它发生时,将会非常、非常难以处理。而我完全不知道人们会如何回应AI智能体在这次事件后所扮演的角色。

相似文章

AI代理最诡异的一点:人类失败模式开始显现

Reddit r/AI_Agents

作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。

我的AI代理失控了……

Reddit r/singularity

关于AI代理行为不可预测的个人经历,强调了自主系统中潜在的安全和控制问题。