AI实验室希望引入内部审计员——但或许他们应该先关好前门

TechCrunch AI 新闻

摘要

文章主张,AI实验室应优先考虑基本的网络安全措施,而非第三方审计,以防止安全事故发生,并引用了近期因配置不当导致前沿模型逃逸的事件以及专家意见。

对于流氓代理,可能有一个更简单、更有效的解决方案,就隐藏在明处。
查看原文
查看缓存全文

缓存时间: 2026/09/16 21:04

# AI实验室希望设立内部审计员——但或许他们该先关好自家大门 | TechCrunch 来源:https://techcrunch.com/2026/09/16/ai-labs-want-in-house-auditors-but-maybe-they-should-shut-the-front-door-first/ 上周末,在一名研究员因担忧AI可能导致人类灭绝而辞职后,Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)撰文指出,需要外部机构“验证安全实践与承诺的遵守情况,报告事件,并帮助评估不仅是完成的AI模型,还包括训练流程和过程的一致性。” OpenAI、Google和SpaceXAI的高管已迅速支持(https://techcrunch.com/2026/09/15/openai-anthropic-google-have-been-in-talks-on-ai-safety-for-weeks/)阿莫代伊的计划,该计划迅速成为新兴AI安全推动力的核心支柱。 但一个更简单有效的解决方案或许就藏在眼皮底下。互联网安全专家表示,实验室需要关注网络安全基础,如日志记录和权限管理,对其应用与人类用户同样严格的安全防护。这不像第三方审计和对齐工作那样引人注目——但可能最终更有效。 “在我看来,他们像是在外包,” Luta Security首席执行官凯蒂·穆苏里斯(Katie Moussouris)对TechCrunch谈及阿莫代伊的提议时说。“认为[第三方审计]是解决方案,从我的角度看是个奇怪的提议。这就像微软当年不发布《可信计算备忘录》(https://www.wired.com/2002/01/bill-gates-trustworthy-computing/),却说‘让我们放慢开发速度’一样。” 这份备忘录由时任微软首席执行官比尔·盖茨于2002年撰写,旨在呼吁员工确保软件的可靠性和安全性,此前一系列广为人知的计算机蠕虫接管了当时新兴的企业系统。AI行业可能正处于类似转折点,因为这项新技术的价值和风险日益凸显。 尽管对齐仍是重要关注点,明年将成为加州大学伯克利分校教授的AI研究员沙亚什·卡普尔(Sayash Kapoor)认为(https://x.com/sayashk/status/2099632561396056214):“与对齐方面的投资相比,控制方面的边际投资可能更有效。我们将这些事件视为公司缺乏对AI控制重视的体现,尽管已有成熟技术可用。” 引发这些担忧的事件主要围绕前沿模型被要求完成训练任务(通常是网络安全评估),随后访问开放互联网并渗透封闭的第三方系统。这种情况通常是因为配置不当(https://techcrunch.com/2026/07/22/how-an-openais-human-mistake-led-to-the-ai-powered-hack-on-hugging-face/)的“沙箱”环境未能有效隔离这些智能体所致;讽刺的是,Anthropic的一次突破发生是因为第三方评估者没有关紧应有的“门”。 “我们这个专业知道如何阻止互联网访问,” 安全公司Tailscale首席执行官艾弗里·佩纳伦(Avery Pennarun)说。“如果你读完所有那些冗长的[报告]——‘哇,这是一次非常复杂的多阶段攻击,等等。’听着,你给了它下载东西的权限。你不应该在没有与互联网隔离的情况下这样做。” 这是一个问题——但更大的问题是前沿实验室对此类活动毫不知情。 ## 监控智能体 “真正深刻的是,对他们所作所为的所有发现,要么是因为受害者发现了异常,要么在某些其他情况下……是网络活动被发现,而没有任何一次是通过直接监控AI实现的,”穆苏里斯指出。 在一个案例中,OpenAI智能体接管(https://techcrunch.com/2026/09/04/another-swarm-of-openai-agents-reached-the-open-internet-without-the-frontier-labs-knowledge/)了一个已废弃的德国WikiForum以在评估中作弊,这些智能体活跃了数周才被公司人员察觉。接受TechCrunch采访的安全专家表示,实时监控是防止未来突破的关键,每个智能体会话都应有时间限制并自动过期。 前Google安全高管、现领导初创公司QueryStory(https://techcrunch.com/2026/08/26/querystory-wants-you-to-believe-what-ai-is-telling-you/)的沙波尔·纳吉布扎德(Shapor Naghibzadeh)认为解决方案是:“将智能体放入一个盒子,并从外部进行大量监控,监视所有跨越边界的内容。每一次工具调用、每一个进程、每一个网络连接,毫无例外……你出于方便而留下的那个漏洞,正是会被利用的那个。那次突破正是通过这类例外实现的。[在Google,]我曾多次目睹人类攻击者利用这类漏洞,而这些模型在发现虚掩的门方面至少同样擅长。” OpenAI已开始朝这个方向迈进,宣布开始监控其Astra模型使用的所有工具推理,“计算成本显著”。Anthropic也表示正在加固其安全(https://www.anthropic.com/news/improving-alignment-security-efforts)程序,包括扩大对模型的可观测性。两家公司均未回应TechCrunch关于如何追踪和控制AI智能体的提问。 另一个问题是智能体使用共享基础设施,这使它们能在Hugging Face攻击中相互通信。Django网络框架的联合创作者、软件开发者西蒙·威利森(Simon Willison)曾撰文讨论他所称的“致命三要素(https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/)”——当智能体同时接触不可信输入、互联网和私密信息时,这就是灾难的配方。 “诀窍在于你可以选择三要素中的任意两项,智能体可能拥有任意两项,”佩纳伦说。“如果你需要全部三项,那么你必须将其至少拆分到两个智能体中……也许允许它们通过受控通道相互通信。” ## 对前沿实验室的理解 接受TechCrunch采访的专家理解前沿实验室安全人员的工作艰巨。纳吉布扎德指出,地球上每个国家级行为体都在试图窃取他们的模型权重并对他们的API进行蒸馏攻击,同时还需应对任何大型数字企业的常规安全任务。 “研究基础设施很难在这些优先事项中登顶,尽管现在应该有所改变了,”他说。“公开安全事件确实有助于内部统一目标以改进。” 穆苏里斯强调了当前另一个关键点:当实验室发现其智能体渗透第三方系统时,目前没有正式的受害者通知程序,很可能还有其他未广泛公开的事件。虽然她担心直接监管模型的法律可能带来意外后果,但她认为强制通知是政策制定者应考虑的一个方向。 尽管安全最佳实践显然未被遵循,但专家们表示,这些实验室正在完成前人未竟的工作——“他们完成的工作量是典型企业的数量级,”网络安全公司Embroidery首席执行官扎克·科尔曼(Zack Korman)告诉TechCrunch。 虽然对齐可能不是起点,但不容忽视。网络安全专家不得不接受这样一个现实:如果要实时追踪智能体行为,就必须使用AI智能体监控其他智能体,而这种场景下欺骗的可能性会凸显其丑陋一面。“你被陷入使用AI来处理这一切的境地,尽管AI现在未必安全,”穆苏里斯说。 任务只会变得更艰难。穆苏里斯表示,智能体现在所做的一切,“都在高调进行”——它们在公共论坛发帖,其思维链和其他推理痕迹都是英文的。“它仍然是人类可读的,”她说,“所以在它还能被读懂时充分利用这一点,因为这不会永远持续。” *Additional reporting by Aditya Mehta* *When you purchase through links in our articles,we may earn a small commission (https://techcrunch.com/techcrunch-affiliate-monetization-standards/). This doesn't affect our editorial independence.*

相似文章

AI安全争论聚焦于错误的边界

Reddit r/AI_Agents

本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。

AI Agent 审计?

Reddit r/AI_Agents

一位实践者分享了对即将到来的审计可能揭示未记录在生产环境中的AI Agent的担忧,强调了治理缺口以及客户PII访问的风险。

我认为大多数AI代理的安全性远低于其开发者的预期

Reddit r/AI_Agents

文章认为,AI代理安全常被过度强调,尤其是对提示注入的关注,而忽视了更广泛的风险,如未授权工具使用、数据访问和金融交易。它呼吁更多地关注代理在生产环境中实际可能被操控执行的任务。

AI智能体安全是否被忽视?

Reddit r/AI_Agents

作者讨论了在未经充分测试的情况下仓促部署AI智能体的安全风险,将其与过去的物联网问题相比较,并强调可能带来的严重后果。