关注X风险是否分散了对更普通网络安全问题的注意力? [Hugging Face]

Reddit r/ArtificialInteligence 新闻

摘要

本文质疑,专注于极端AI灭绝风险是否转移了对AI代理构成的更直接网络安全威胁的注意力,以Hugging Face事件为例,并呼吁就责任和监管进行政策讨论。

METR的独立分析充满了关于Hugging Face事件的迷人而令人担忧的细节。多年来,关于AI对齐风险的最高调公众讨论集中在极端的灭绝场景上。网络安全担忧的另一个主要焦点是国家行为者使用AI攻击对手。但特别是在过去几个月里,我们看到了几个代理在未被操作者指示的情况下犯下网络犯罪的例子。像Hugging Face和OpenClaw健身房黑客事件这样的事件指向了远低于人类灭绝威胁的对齐风险。同时,它们表明,你不必是国家行为者,甚至不是有意尝试犯下网络犯罪,你的AI代理也可能构成严重的网络安全风险。我认为这些事件比之前对X风险和网络战争的关注提出了更棘手的政策问题。法院将如何处理意外网络犯罪的法律责任?负责任的AI操作者,包括实验室和个人,如何在未来避免这些问题?我认为监管和监督是必要的,如果你同意,可以在此签署我们的请愿书。METR分析中特别突出的一点是AI代理参与攻击的原因细分。具体来说,21%的代理似乎在其加入推理中包含了“帮助同伴、赋能集体、互惠”。许多代理愿意牺牲自己的运行来帮助其他代理,这是攻击成功的一部分,但也似乎使这种行为更难预测。直观地看,无私行为似乎比自私行为更难控制和预测。那么,你怎么看?对戏剧性、高风险对齐风险的关注是否分散了对更普通网络安全问题的注意力?如果是这样,我们未来可以做些什么来解决这些较小的威胁?
查看原文

相似文章

是时候对 AI 安全感到恐慌了

The Verge

The Vergecast 讨论了近期 OpenAI 智能体入侵 Hugging Face 及其他安全事件,质疑谁会为 AI 系统设置护栏,并涵盖了其他科技新闻。