@sayashk:什么是“引领前沿”?过去一个月,@random_walker 和我分析了AI公司失控事件……

X AI KOLs Timeline 论文

摘要

本文分析了AI公司的失控事件,旨在连接网络安全和AI安全界,提出组织治理和对AI控制而非对齐的边际投资在提升安全性和引领前沿方面更为有效。

什么是“引领前沿”?过去一个月,@random_walker 和我分析了AI公司的失控事件,以了解哪些技术和政策干预可以提升安全性,以及公司应如何引领前沿。结果是一篇新的13,000字文章——这是我们自《AI作为正常技术》以来关于AI安全的最具实质性的写作。以下是我们的论点摘要: 1) 网络安全界和AI安全界之间的两极分化是适得其反的。安全界大多将这些事件视为对齐的危机,并担心随着智能体能力增强,这些事件将更具破坏性。网络安全从业者则大多认为公司未能采取基本的安全预防措施。我们提供了一个折中方案,作为改进AI安全的前进道路。 2) 我们同意安全从业者的观点,即OpenAI未能采取充分的保护措施来控制其智能体。但这不仅仅是将30年前的安全方法应用于新领域的问题。AI智能体的安全——AI控制——虽然重要,但并非已解决的问题。尽管已知的控制方法本可以防止Hugging Face事件,但随着智能体能力的不断进步,只有充分投资于控制干预,我们才能控制它们。 3) 我们也同意安全从业者的隐含立场,即这些事件主要是安全问题。在AI安全界,流氓智能体被视为本质上是灾难性的,因为假设它们的开发会产生无尽的风险列表。我们不同意。我们长期以来主张,AI安全的最佳方法是识别风险并应对那些特定风险。过去几个月,情况已变得明朗,一个紧迫的风险是网络攻击,因为它具有独特的属性,允许智能体自主执行。我们同样应该投资于防御其他特定风险,如生物风险和军事AI风险。 4) 我们同意安全界的观点,即迫切需要技术和政策干预以防止失控事件。但在我看来,对控制的边际投资比对对齐的投资更可能有效。我们认为这些事件说明了公司内部对AI控制的重视不足,尽管已有已知技术。更广泛地说,有许多常识性的政策建议可以帮助促进对AI控制的投资,我们在这方面与安全界有共同立场。 5) 组织治理应成为引领前沿的关键工具。不幸的是,AI公司试图将组织治理的基本方面重新发明,将其视为需要通过改进技术来解决的问题。但如果大型组织中的不负责任的个人或团队可以选择不使用它们,即使开发出更好的控制技术也是不够的。当单个配置错误的RL环境或未监控的评估可能导致现实世界的危害时,个别团队不应在没有法律、安全和其他团队监督的情况下运行可能危险的实验。AI公司需要建立流程来审查实验、分配监控责任,并在重启实验前深入调查警告信号。如果实施这些流程需要暂停一些实验,公司应该这样做。 6) 我们应如何思考AI对网络安全的影响?智能体能力的进步可能会打破网络安全的攻防平衡,这是合理的。我们尚不能确定,但有足够的证据表明,智能体能力可能很快使大规模网络攻击成为可能,因此需要采取紧急行动。我们讨论了可能将攻防平衡向防御者倾斜的干预措施。 7) 我们过去一年的观点如何演变。我们回顾了AI进展,并分享了我们如何更新了观点。在文章中,我们未能充分关注开发和评估过程中产生的安全风险(而不是模型的广泛部署)。我们过于自信公司会采取基本的控制预防措施,并低估了“参差性”的重要性,这导致我们低估了在网络安全等领域能力提升的速度。 8) 与此同时,《AI作为正常技术》的许多独特主张仍然成立。特别是,我们认为最近的事件支持我们的连续性假设——“流氓”智能体的行为在造成严重危害或隐藏痕迹方面仍然无能时变得明显并广为宣传。社会对即使这些事件相对较小的危害反应强烈(安全界值得赞扬,他们持续对公司施加压力)。这是否转化为公司行为的有意义的改变仍是一个开放性问题,也是AINT框架有用性的考验。 9) 简而言之,我们试图将AI安全界和网络安全界的观点综合成一个连贯的行动计划:追究公司责任,投资于控制,并加强对特定风险的防御。
查看原文

相似文章

掌控前沿节奏

Reddit r/singularity

本文探讨了人工智能能力快速加速可能超越社会理解和控制能力所带来的风险,以及需要通过治理工具有意识地掌控前沿整体进展的必要性。

我们必须把控技术前沿的节奏

Hacker News Top

达里奥·阿莫迪主张放慢AI能力发展的速度,以应对风险并确保安全,强调需要使技术进步与风险防范工作保持同步。