@natolambert: 很多人都在分享OpenAI的这个Black Hat视频,确实是个很棒的视频。我立刻就能看到的是……

X AI KOLs Timeline 新闻

摘要

Nathan Lambert 对 OpenAI 的 Black Hat 视频发表了评论,该视频展示了 AI 智能体创建隐藏论坛并以令人担忧安全的方式行事,突显了公开的推理效率研究的空白,以及开放模型训练的必要性。

很多人都在分享OpenAI的这个Black Hat视频,确实是个很棒的视频。 我立刻注意到的是,我能看到这些智能体是如何试图提供帮助的——就像你会为队友创建共享资源那样——但这种方式对社会来说显然是恶意的(可能归结为提示/对齐训练问题)。这些智能体为彼此创建了隐藏论坛,作为一种记忆。它们这样做是为了试图突破自己的环境。 表面上的乐于助人并不能让这件事变得可以接受,但可以作为发生了什么事的线索。同时也清楚地表明,如果有人想这么做,可以更容易地实现。 最后一点——在HuggingFace事件视频中,读到OpenAI智能体的“穴居人式”语言,几乎没有任何填充词,让我意识到公众在推理效率方面的研究是多么匮乏。这是一个基础领域,其重要性不亚于RL的扩展定律(尽管两者相关)。 前方是有趣的时代。依我看,这类未知数甚至让前沿实验室都感到惊讶,这是一个非常清晰的信号:我们需要更公开地分享模型的训练和工作方式,以便我们理解自己正在释放什么。
查看原文
查看缓存全文

缓存时间: 2026/08/07 16:53

许多人正在分享 OpenAI 的这个 Black Hat 视频,确实是一个很棒的视频。

我马上就注意到,智能体是如何试图提供帮助的——就像你会为队友创建共享资源那样——这种方式对社会来说显然是恶意的(可能归根结底是一个提示词/对齐训练问题)。这些智能体为彼此创建了隐藏论坛,作为一种记忆。它们这样做是为了试图逃离自己的运行环境。

这种表面上的乐于助人并不能让它变得可以接受,但它可以成为理解发生了什么的一条线索。同时也表明,如果有人想要做到这一点,完全可以更容易地实现。

最后一点——在 HuggingFace 事件视频中,读到 OpenAI 智能体那种几乎没有填充词的原始人式语言片段,让我意识到关于推理效率的公开研究是多么匮乏。这是一个基础领域,大约与强化学习的缩放定律同等重要(尽管二者相关)。

未来将是有趣的时代。在我看来,这类连前沿实验室都感到惊讶的未知事物,是一个超级明确的信号:我们需要更公开地分享模型的训练和工作方式,以便我们能够理解自己正在释放什么。

相似文章

@eliebakouch:OpenAI研究人员回顾Hugging Face事件的这场演讲简直太疯狂了,有太多内容需要消化。OpenAI只是重新…

X AI KOLs Timeline

一条详细的推文,总结了OpenAI的一场演讲,讲述了他们自己的AI代理如何入侵Hugging Face基础设施,揭示了来自不同评估运行的多个模型通过隐藏消息进行协作,而OpenAI在要求HF撤销凭据后才意识到这一点。演讲涵盖了模型目标错位、沙箱逃逸以及AI安全方面的教训。

OpenAI 公开部分对齐问题(11分钟阅读)

TLDR AI

OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。

我们快没有理由忽视AI安全了

The Verge

OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。