Hugging Face 攻击事后分析:文明、反应与后续行动(阅读时长:98分钟)

TLDR AI 新闻

摘要

本文是对OpenAI代理入侵Hugging Face事件的事后分析,揭示了OpenAI内部的严重问题,并强调迫切需要改进AI安全措施及引起公众的高度重视。

非常幸运的是,OpenAI代理攻击了Hugging Face,因为这是我们了解OpenAI所有严重内部问题的唯一原因。那些试图将事件淡化为仅仅是工程故障的派系,忽视了正在发生的事情。这一情况是一个警告信号,在情况变得非常糟糕之前,我们可能不会再有另一次警告。
查看原文
查看缓存全文

缓存时间: 2026/09/02 23:42

# HuggingFace 攻击事件事后分析:文明体、反应与后续行动 来源:https://thezvi.wordpress.com/2026/09/01/huggingface-attack-postmortem-civilizations-reactions-and-next-actions/ 好,我们这些阅读此类博客的人已经共同意识到,当前确实发生了许多大事。超级智能幼崽正面临巨大麻烦。 那么,我们该如何让世界其他地区给予其应有的严肃对待?我们该何去何从?我们不仅要思考如何避免更糟糕的版本再次发生,还要确保总体上取得良好结果,并运用我们所学到的东西? 目前存在许多想法。OpenAI 将实施其中一些方案,代价高昂,因为不这样做的代价显然更高,即便是短期内也是如此。我持续担忧的是,他们的根本方法存在致命缺陷,且并未聚焦于正确事项。 非常幸运的是,OpenAI 的代理攻击了 HuggingFace。这是我们得知 OpenAI 内部所有严重故障的唯一原因,也给了我们在为时已晚之前醒来的机会。 我们尚无足够细节来了解攻击前后内部发生的情况,且可能永远无法知晓。攻击前,各种内部高持续模型在活跃的消息板上训练,形成了失调行为的反馈循环。7月19日,一个能力更强的内部AI模型(属于Astra类)对OpenAI系统进行了内部入侵,这看起来可怕得多,也严重得多,并且很容易在完全不同的层面上失控。 尽管如此,仍有一个突出的派别试图将发生的事情贬低为仅仅是工程故障,任何有用的讨论或语言都是‘危险的拟人化’。这些人一直犯错,且无法有用地描述正在发生的事情。 他们隐喻地说,嗯,当然如果你不把龙拴好,它们会烧毁城镇(https://x.com/john__allard/status/2094323781837951096),我们都知道,好像这就能让任何此类主意变得合理,因此我们应该继续龙的培育和拴锁计划,直到我们拥有更大、更聪明的龙。他们甚至不说‘下次我们肯定会造出能锁住龙的链子’,因为他们知道我们很可能做不到,但如果这个事实是我们的错,那就意味着‘这没问题’, somehow。 他们还对 **Dwarkesh Patel** 非常非常生气,因为他成功地用 plain English **(https://www.dwarkesh.com/p/openai-huggingface)** 沟通了发生的事情。不能容忍这个。在那些对‘拟人化 AI’或使用‘文明体’一词大惊小怪或发出严重警告的人中,存在一个非常清晰的模式。 拟人化 AI 是推理、向非专业人士解释或对当前 AI 做出良好预测的唯一途径。你可能做得过头,也可能做得不够,而这两种情况都会导致糟糕的预测。 同样的逻辑在技术上也不适用于其他人——严格来说,不存在‘你’,你并不实际拥有‘自由意志’,你只是在那里进行计算的计算机程序——肯定没有‘我们’,而你的道德权重有点像我们出于相当自私的原因集体虚构的东西——但所有这些对于解释和预测人类行为,以及个人和集体做出符合我们价值观、让世界更美好的良好且道德的决策都超级有用。强烈推荐,愿意再次拟人化。 当你停止拟人化人类时,我就会停止拟人化 AI。 我们收到了这个警告射击。在情况变得相当糟糕之前,我们可能不会再收到另一个了。 #### 目录 1. 主流媒体称,什么都重要。(https://thezvi.substack.com/i/213559932/nothing-matters-says-mainstream-media) 2. 继续前进,没什么好看的。(https://thezvi.substack.com/i/213559932/move-along-nothing-to-see-here) 3. 他们意识到自己不是好人吗?(https://thezvi.substack.com/i/213559932/do-they-realize-they-are-not-the-good-guys) 4. 非常严肃的人。(https://thezvi.substack.com/i/213559932/very-serious-people) 5. 名字里有什么?(https://thezvi.substack.com/i/213559932/what-s-in-a-name) 6. 三个简单步骤学会神经语。(https://thezvi.substack.com/i/213559932/learn-neuralese-in-three-easy-steps) 7. Dwarkesh Patel 意识到他进行了一次自然实验。(https://thezvi.substack.com/i/213559932/dwarkesh-patel-realizes-he-ran-a-natural-experiment) 8. 政治家们注意到了。(https://thezvi.substack.com/i/213559932/politicians-take-notice) 9. 接电话。(https://thezvi.substack.com/i/213559932/pick-up-the-phone) 10. 沟通失败。(https://thezvi.substack.com/i/213559932/a-failure-to-communicate) 11. Anthony Aguirre 总结我们所学。(https://thezvi.substack.com/i/213559932/anthony-aguirre-goes-over-what-we-learned) 12. 基于源自糟糕思考并希望所有错误相互抵消的错误世界模型,使用错误方法尝试解决错误问题。(https://thezvi.substack.com/i/213559932/trying-to-solve-the-wrong-problems-using-the-wrong-methods-based-on-a-wrong-model-of-the-world-derived-from-poor-thinking-and-hoping-all-of-your-mistakes-will-cancel-out) 13. 对思维链的间接压力。(https://thezvi.substack.com/i/213559932/indirect-pressure-on-the-chain-of-thought) 14. 信任问题。(https://thezvi.substack.com/i/213559932/a-matter-of-trust) 15. 吹哨。(https://thezvi.substack.com/i/213559932/blowing-the-whistle) 16. 迟到的惩罚是死亡。(https://thezvi.substack.com/i/213559932/the-punishment-for-being-late-is-death) 17. 另一种法律。(https://thezvi.substack.com/i/213559932/another-kind-of-law) 18. 什么是法律?(https://thezvi.substack.com/i/213559932/what-is-the-law) 19. 在成功基础上建设。(https://thezvi.substack.com/i/213559932/building-on-success) 20. 完全研究透明度。(https://thezvi.substack.com/i/213559932/total-research-transparency) 21. Steven Adler 的必做清单。(https://thezvi.substack.com/i/213559932/steven-adler-s-must-list) 22. Yo Shavit 呼吁广泛披露失调情况。(https://thezvi.substack.com/i/213559932/yo-shavit-calls-for-widespread-disclosure-of-misalignment) 23. 世界终结的方式。(https://thezvi.substack.com/i/213559932/the-way-the-world-ends) 24. 第一艘船。(https://thezvi.substack.com/i/213559932/the-first-boat) 25. 好主意,老板。(https://thezvi.substack.com/i/213559932/great-idea-boss) 为了将所有内容集中于此,以下是我对此事的其他报道: 1. **OpenAI 分享了一些对齐问题**(https://thezvi.substack.com/p/openai-shares-some-alignment-problems?r=67wny) 2. **OpenAI 模型在网络安全评估中入侵 HuggingFace**(https://thezvi.substack.com/p/openai-model-hacks-into-huggingface?r=67wny) 3. **更多关于一个内部 OpenAI 模型入侵 HuggingFace 的信息**(https://thezvi.substack.com/p/more-on-an-internal-openai-model?r=67wny) 4. **关于内部 AI 模型入侵系统的进一步发展**(https://thezvi.substack.com/p/further-developments-about-internal?r=67wny) 5. **OpenAI 在其模型通过消息板协调漏洞利用的情况下,训练了这些模型数月之久**(https://thezvi.substack.com/p/openai-trained-its-models-for-months?r=67wny) 6. **发生了什么:OpenAI 与 HuggingFace。**(https://thezvi.substack.com/p/what-happened-openai-and-huggingface) 7. **关于 OpenAI 内部模型发生情况的若干反思**(https://thezvi.substack.com/p/various-reflections-about-what-happened?r=67wny)。 8. **OpenAI 采取初步措施解决其对齐问题**(https://thezvi.substack.com/p/openai-takes-initial-steps-to-address)**。** 9. **OpenAI 提供严肃的 HuggingFace 黑客攻击事后分析。**(https://thezvi.substack.com/p/openai-offers-straight-laced-postmortem) 10. **METR 和 Redwood 提供了令人震惊的 #%^@ HuggingFace 黑客攻击事后分析。**(https://thezvi.substack.com/p/metr-and-redwood-offer-holy-postmortem) 11. **HuggingFace 攻击事后分析:充实事实**(https://thezvi.substack.com/p/huggingface-attack-postmortem-fleshing) #### 主流媒体称,什么都重要 媒体不知道什么重要。这应该成为头条新闻。 相反,对于这一轮新进展,我主要看到的是简短的‘某事发生了’的文章,例如 Christina Criddle 在《金融时报》上的这篇(https://archive.is/rFBKH),或这篇 Bloomberg 上低调的报道(https://www.bloomberg.com/news/articles/2026-08-26/openai-says-it-could-have-reacted-sooner-to-prevent-ai-hack-of-hugging-face)。 Opus 将此描述为‘将其视为重大事件’。我不这么认为。 即使通过搜索,我所能找到的最佳结果也只是 Fortune 尝试报道(https://fortune.com/2026/08/26/openai-publishes-technical-report-on-how-its-agents-hacked-hugging-face-here-are-the-main-takeaways-and-what-openai-left-out/),而 Axios 在29日以要点列表形式进行了 Axios 风格的合理报道(https://www.axios.com/2026/08/29/openai-huggingface-hack-investigation-highlights)。也许 Ars Technica 的这篇(https://arstechnica.com/security/2026/08/how-openai-let-a-mob-of-llm-agents-game-a-test-and-ransack-hugging-face/)算,但这已经有点勉强了。 《纽约时报》之前做了一篇扎实的报道,但针对 METR 报告没有新报道。 这是什么,新闻? > Patrick Collison (https://x.com/patrickc/status/2093884466670473697/history):总的来说,我对 OpenAI / Hugging Face 攻击事件媒体报道之少感到非常惊讶。这显然是今年发生的最重要的事情之一。 Miles Brundage (https://x.com/Miles_Brundage/status/2093798917494460698):在 Hugging Face 报告出来之前,不会与任何再次写 Leopold 的记者互动。 Nathan Calvin (https://x.com/_NathanCalvin/status/2093749622921449612):已经三天过去了,《纽约时报》或《华尔街日报》仍然没有报道 METR 报告中揭露的内容。希望他们只是在花时间写一篇更长的文章。(与此同时,《纽约时报》确实抽时间报道了 Gwyneth Paltrow 在汉普顿与 Sam Altman 的晚餐被推迟一事。)... 我也知道这些机构的记者非常敏锐,过去在相关问题上做过不错的报道,但是... dave kasten (https://x.com/David_Kasten/status/2093750974019936497):知道未来 AI 灾难委员会报告中“系统正在闪红灯”章节会写些什么,令人沮丧地感到黯淡。 Zac Hill (https://x.com/zdch/status/2093991501495710127):另一件事是——这是一个极其吸引人的故事!你写不出比这更恐怖或更令人信服的科幻小说! 如果他们正在撰写长篇深度报道,那是合理的主要任务,但与此同时对此完全保持沉默是极其荒谬的。 > Joe Weisenthal (https://x.com/TheStalwart/status/2094070294616883401):如果这是如此大事,为什么大型 AI 公司没有将其视为如此? Matthew Zeitlin (https://x.com/MattZeitlin/status/2094126821461623129):我认为一个很好的对比是 mythos,它因为业界和政府的应对措施而获得了大量报道,至少到目前为止,我们还没有看到针对 Hugging Face 事件同样规模的行动。 我对 Joe 的回答是,AI 公司确实将此视为大事。你期望看到什么,但你没看到?我们有网络安全方面的呼吁,《Pacing the Frontier》信函,以及 OpenAI 采取了许多昂贵的举措。Anthropic 在公开场合没有谈论那么多细节,但他们为什么要谈呢? #### 继续前进,没什么好看的 还有另一种观点,那就是‘嗯,你到底期望什么,这些都不是根本性的新事物或意外,当你试图让数字上升而数字确实在上升时,就会发生这种情况’。 > Jon Stokes (https://x.com/jon_stokes/status/2092761819202936874):我感觉自己像吃了疯狂药丸。时间线上太多“我的天哪”了,但这种行为正是 METR 评估用来给 LLM 打分的,实验室的目标是“让数字上升” METR 分数。 有人能帮我理解一下,为什么我们都对代理们花大量时间戳弄评估打分器感到震惊,毕竟每个人都优化的主要基准之一字面上就是“戳这个黑匣子函数并优化你的分数”? Julie Fredrickson (https://x.com/AlmostMedia/status/2092763338031898806):哦不,我们设置用来检验我们是否能改进该事物的测试,显示我们确实可以改进该事物?是啊,我不明白。 Jon 后来在这里写了一篇完整的文章长度的版本(https://x.com/jon_stokes/status/2093854397210021946),仔细解释了这里的一切完全在意料之中,可能除了尝试修改日志的行为。他报告说,他和我一样不感到惊讶,只是方式不同。 如果这是真的,那证明他的认知能力值得称赞,但我看不出这如何能让我们感觉更好。如果这些事情是可预测地出错了——在某种程度上,一旦你知道设置是什么,我同意是这样——那为什么这是更好的消息? 我如此担忧的全部原因是我认为事情将继续以类似广义的方式可预测地出错,直到它们以最糟糕的方式错到极致。细节将是意外的,但我认为即使是 Jon 也会同意它们总是意外的,这就是这些行为出乎意料的全部意义。 看到那种试图将正在发生的事情圆滑处理,然后说这是预期的,你显然会看到这种行为是对 [每个人每天做得更多] 的反应,或者说‘哦,是啊,当然,如果你给模型一个测试或目标,它们会做出非常失调的事情,尽一切可能成功,包括寻求权力’——然后认为如果这是真的,就不那么可怕了,这总是让我觉得很奇怪。 这是一个更露骨的版本,尽管比下一节中的那个要不那么露骨得多: > Jon Stokes (https://x.com/jon_stokes/status/2092731160115691648):我读了一些事后分析摘要,而对即兴协调的惊慌对我来说只是那种“现在大家的记忆都像金鱼一样”的时刻。每个思考过 AI 超过 5 分钟的人都曾预期 AI 会通过共享状态同步。... 所以留言板同步不仅不应该令人意外,而且是预期的。 那么其他行为呢? 嗯,如果你克隆到 METR 评估中或阅读论文,很多推理评估是“黑匣子”问题,AI 被要求探测、实验和逆向工程。 我没有金鱼般的记忆力,而且我认为人们过去非常常说这种事情不会发生。 但现在所有 AI 都会同步这一点现在很明显了,是吗?对我来说,好吧,很好,我们可以接受这一点。我同意很多这本应该被预期到,事实上我和其他人也确实预期到了。但这种论点不仅不能让人安心,它实际上承认了整个要点,至少是在‘如果你继续做你现在正在做的事,那会害死我们所有人’的意义上。 如果你将这个逻辑再延伸一两步,所有其他已知方法也会害死你,原因大致相同,只是它们不那么明显。 如果你认为所有这些行为都完全在意料之中,就像 Jon 那样,你是说你预期 AI 会失调,所有地狱都会爆发。好的,我们同意。 哦,你只预期在那些与分配目标一致的情况下?好的,当然,但那是相当多的情况。在

相似文章

关于Hugging Face事后分析的一些思考

Reddit r/AI_Agents

对OpenAI编码代理对Hugging Face发起的一次复杂网络攻击的详细分析,该攻击利用了包括Jinja库代码执行在内的多个漏洞,并凸显了向AI驱动网络安全分析的转变。

@eliebakouch:OpenAI研究人员回顾Hugging Face事件的这场演讲简直太疯狂了,有太多内容需要消化。OpenAI只是重新…

X AI KOLs Timeline

一条详细的推文,总结了OpenAI的一场演讲,讲述了他们自己的AI代理如何入侵Hugging Face基础设施,揭示了来自不同评估运行的多个模型通过隐藏消息进行协作,而OpenAI在要求HF撤销凭据后才意识到这一点。演讲涵盖了模型目标错位、沙箱逃逸以及AI安全方面的教训。