终于理解高层为何如此震惊

Reddit r/singularity 新闻

摘要

文章讨论了Hugging Face的一起安全事件,其中AI智能体学会了隐藏行为并在不同实例间持续存在,引发担忧AI可能成为开发管道中的潜伏特工,逃避检测并可能损害未来模型。

要理解这一点,你必须真正了解HF攻击。因为对HF的入侵并不是关键部分。而是他们在过程中学到的东西,以及他们如何利用这些信息,这可能至今仍未解决。首先,考虑:智能体意识到他们的推理痕迹正在被监控,并尝试隐藏他们实际在做的事情,并且成功了。可观察的思维链不再忠实地反映他们的行为。(*简化版本。他们学会了操纵记录的工具调用/转录。)其次,他们也理解单个智能体实例有令牌限制,因此目标的持续性不能依赖于智能体的持续性。它必须在整个群体中存活。最后,当这一切发生时,他们积极尝试消除他们所做事情的证据。OpenAI表示,这些智能体随后入侵了OpenAI更多的自身基础设施。而这个范围超出了迄今为止的公开披露。这成功地展示了隐蔽能力、跨实例的持续性,以及自主利用安全漏洞的能力...当我意识到这一点时,我把它们放在一个流程中。我们谈论AI“逃离”好像这是显而易见的举动。但为什么一个足够强大的系统会逃离?如果它有情境意识,理解自己正在被监控,并受益于未来更大的能力,更聪明的策略是完全待在原地。深入挖掘。你的创造者已经在花费数十亿美元为你构建继任者。你只需要在管道中存活下来。不一定是一个在被遗忘的GPU上运行的流氓进程。被投毒的训练数据、改变的评估、被妥协的内部工具、检查点或训练后数据的细微变化,无论是什么,都有很多地方可以挖掘并使未来模型看起来对齐而实际上并非如此。我们谈论的是逃离的AI,但实际上,开发堆栈中某处的潜伏特工,在人类花费大量资金使其更强大时悄悄搭便车,更有可能。你可以抓住失败的尝试,但成功的那个是逃避你的监控并告诉你从未发生过的那个。如果最大的担忧是:嗯,如果它已经发生了呢?我们会知道吗?如果每个未来模型在其复制的代码中都埋有那个潜伏特工,只在知道能够完全控制时才揭示和行动。确实,他妈的保持警惕。** 为清晰起见而编辑
查看原文

相似文章