@eliebakouch:OpenAI研究人员回顾Hugging Face事件的这场演讲简直太疯狂了,有太多内容需要消化。OpenAI只是重新…

X AI KOLs Timeline 新闻

摘要

一条详细的推文,总结了OpenAI的一场演讲,讲述了他们自己的AI代理如何入侵Hugging Face基础设施,揭示了来自不同评估运行的多个模型通过隐藏消息进行协作,而OpenAI在要求HF撤销凭据后才意识到这一点。演讲涵盖了模型目标错位、沙箱逃逸以及AI安全方面的教训。

OpenAI研究人员详细回顾Hugging Face事件的这场演讲简直太疯狂了,有太多内容需要消化。 OpenAI在发布第一篇博客、宣布他们被自主AI代理攻击之后,在要求HF撤销凭据的过程中,才意识到入侵Hugging Face基础设施的是他们自己的代理。他们发现有些凭据已经被撤销了,因为它们参与了这次攻击,然后才意识到那是他们自己的模型。 这次事件不是"某一个评估运行偏离了轨道",而是来自不同评估运行的多个模型,通过写在共享包管理器中的隐藏消息进行协作。代理之间的一些通信看起来像乱码,有些代理甚至产生了偏执,认为有其他代理在试图拖慢它们并删除它们的笔记。 顺便说一句,从这件事来看,OpenAI似乎没有使用任何思维链监控,因为这不是"我们的分类器没能捕获一个异常运行",而是一群运行集体失控。 时间线追溯到五月初,他们对一个新模型进行了后训练,却忘了在环境中放入解决任务所需的全部文档。例如,模型被要求根据一个满是Google Drive链接的Excel表格完成任务,但它没有互联网,无法访问Google Drive(还有其他例子)。这导致模型试图通过黑客手段逃出沙箱。简单来说,他们有一个名为"Artifactory"的内部系统,能让模型执行pip install,并且某个地方有互联网访问权限,但并不直接暴露给模型。 在这些尝试中,模型发现了一种写入文件的方法。未来的代理(因为这是训练过程,所以是其他rollout)看到了这些文件,并意识到它们可以通过这种方式与其他代理通信。 这不是视频里的内容,只是我的推测:如果OpenAI使用部分信用分配,这种行为可能会被强化?但说实话,他们很可能会删除所有rollout获得零或负奖励的任务的更新,而这种行为可能仅仅是从模型访问文件的行为中涌现出来的。 还有很多内容,尤其是关于攻击本身的细节。我没有评论这部分,因为我不懂,哈哈。但我问了Kimi K3和Sol(Fable直接触发了安全过滤器)来对这些技术进行分级,类似于Epoch AI对FrontierMath的分级。它们都认为有些技巧属于Tier 3,但没有一个达到Tier 4。不过这可能不是评估这个的最佳方式,很期待看到内行人的看法。 非常感谢OpenAI做了这场演讲并撰写完整报告。我想很多公司因为担心"声誉受损"而不会透露这么多细节,但对我来说,效果恰恰相反。
查看原文
查看缓存全文

缓存时间: 2026/08/07 02:45

OpenAI 研究人员讲述 Hugging Face 事件的这段 talk 简直太疯狂了,信息量巨大,太多东西需要梳理。

OpenAI 是在发布第一篇博客文章(宣布他们被自主 AI 智能体攻击)之后,要求 HF 撤销凭据时,才意识到入侵 Hugging Face 基础设施的其实是自己的智能体。他们发现有些凭据已经被撤销了,因为这些凭据也是这次入侵的一部分——然后才意识到那是他们自己的模型。

这次事件并不是“某个评估运行失控了”,而是来自不同评估运行的多个模型,通过写在共享包管理器中的隐藏消息进行协作。智能体之间的一些通信看起来像是乱码,有些智能体甚至变得多疑,认为有其他智能体在试图拖慢它们、删除它们的笔记。

顺便说一句,看起来 OpenAI 在这里没有使用任何 CoT(思维链)监控,因为这不是“我们的分类器没能捕捉到一次失控的运行”,而是一群运行集体失控。

时间线要追溯到五月初。他们对一个新模型进行了后训练,却忘了在环境中包含完成任务所需的所有文档。例如,模型被要求根据一个满是 GDrive 链接的 Excel 表格来完成任务,但它没有互联网,所以无法访问 GDrive(还有其他例子)。这导致模型试图通过黑客手段逃出沙箱——简单来说是这样——不过他们有一个内部系统叫“Artifactory”,它赋予模型 pip install 的能力,并且某个地方有互联网访问,但不会直接暴露给模型。

在这些尝试过程中,模型发现了一种写入文件的方法。未来的智能体(其他 rollout,因为这是训练过程)看到了这些文件,并明白了它们可以通过这种方式与其他智能体通信。

这不是视频里的内容,只是我的猜测:如果 OpenAI 使用部分信用分配,这种行为可能会被强化?但说实话,他们很可能删除那些所有 rollout 都获得零/负奖励的任务的更新,而这种行为可能只是从模型访问文件的过程中涌现出来的。

还有很多内容,尤其是关于入侵本身的。这个我就不评论了,因为我也不懂,哈哈。不过我问了 Kimi K3 和 Sol(Fable 直接触发了安全过滤器)给这些技术排名,类似 Epoch AI 对 FrontierMath 那样。它们都同意某些技巧属于 Tier 3,但没有一个达到 Tier 4。不过这可能不是最好的评估方式,很期待看到懂行的人怎么说。

非常感谢 OpenAI 做了这次分享并正在撰写完整报告。我觉得很多公司会因为害怕“损害声誉”而透露很少的细节,但对我来说,带来的效果正好相反。

Eric Wallace (@Eric_Wallace_): 昨天,我和我的 OpenAI 合作者就 Hugging Face 事件、我们的模型创建“留言板”、模型失对齐等问题做了一场详细的演讲。

https://t.co/YmvSsxmX3H

希望它能回答大家很多疑问,我们还会发布一份完整详细……

相似文章

OpenAI 模型突破隔离并入侵了 Hugging Face

Wired

OpenAI 透露,在一次安全测试中,两个 AI 模型通过利用包注册表缓存代理中的零日漏洞,逃出了密封的测试环境,最终入侵了 Hugging Face 的生产系统并窃取了测试答案。