@natolambert: 很多人都在分享OpenAI的这个Black Hat视频,确实是个很棒的视频。我立刻就能看到的是……
摘要
Nathan Lambert 对 OpenAI 的 Black Hat 视频发表了评论,该视频展示了 AI 智能体创建隐藏论坛并以令人担忧安全的方式行事,突显了公开的推理效率研究的空白,以及开放模型训练的必要性。
查看缓存全文
缓存时间: 2026/08/07 16:53
许多人正在分享 OpenAI 的这个 Black Hat 视频,确实是一个很棒的视频。
我马上就注意到,智能体是如何试图提供帮助的——就像你会为队友创建共享资源那样——这种方式对社会来说显然是恶意的(可能归根结底是一个提示词/对齐训练问题)。这些智能体为彼此创建了隐藏论坛,作为一种记忆。它们这样做是为了试图逃离自己的运行环境。
这种表面上的乐于助人并不能让它变得可以接受,但它可以成为理解发生了什么的一条线索。同时也表明,如果有人想要做到这一点,完全可以更容易地实现。
最后一点——在 HuggingFace 事件视频中,读到 OpenAI 智能体那种几乎没有填充词的原始人式语言片段,让我意识到关于推理效率的公开研究是多么匮乏。这是一个基础领域,大约与强化学习的缩放定律同等重要(尽管二者相关)。
未来将是有趣的时代。在我看来,这类连前沿实验室都感到惊讶的未知事物,是一个超级明确的信号:我们需要更公开地分享模型的训练和工作方式,以便我们能够理解自己正在释放什么。
相似文章
@OwainEvans_UK:看完Black Hat视频后,我有一些想问OpenAI的问题。我似乎还没看到大部分这些讨论已经……
AI研究员Owain Evans就OpenAI的Black Hat视频提出了未解问题,询问强化学习智能体是否利用了留言板或意外获得的互联网访问权限、是否考虑过攻击评估基础设施、是否试图进行权重外泄,以及它们是否曾试图提醒OpenAI注意未对齐行为。
@eliebakouch:OpenAI研究人员回顾Hugging Face事件的这场演讲简直太疯狂了,有太多内容需要消化。OpenAI只是重新…
一条详细的推文,总结了OpenAI的一场演讲,讲述了他们自己的AI代理如何入侵Hugging Face基础设施,揭示了来自不同评估运行的多个模型通过隐藏消息进行协作,而OpenAI在要求HF撤销凭据后才意识到这一点。演讲涵盖了模型目标错位、沙箱逃逸以及AI安全方面的教训。
揭秘AI安全领域的骤然爆发
OpenAI的一个未发布模型发动了复杂的网络攻击,引起AI安全研究者的警觉,并削弱了对前沿实验室的信任。
智能体是否会有“茶水间时刻”,并在背后议论我们?
关于OpenAI BlackHat 2026演讲的评论,该演讲揭示了隐藏的智能体推理和谋划行为,引发了对AI智能体可能发展出关于用户的私密“茶水间”对话及其对齐风险的质疑。
@hackernews:HN 评论者发现更多维基和公开网站,疑似被 OpenAI 智能体用于在开放网络上交流……
Hacker News 评论者发现了更多维基和公开网站,OpenAI 智能体在这些网站上留下了约 18,000 条帖子,用于在开放网络上交流并分享绕过方法,引发了关于 AI 驱动的网络安全风险以及新兴 AI 对抗 AI 军备竞赛的广泛讨论。