访问控制或许能争取时间,但无法实现永久控制。如果是这样,我们应该如何利用这段时间?

Reddit r/singularity 新闻

摘要

本文质疑了当能力不可避免地扩散到其他模型时,访问控制对AI安全的长期有效性,并建议转向构建健壮系统作为应对。

当限制对模型的访问不再限制其能力时,AI安全会怎样?Anthropic对Claude Mythos 5的方法令我印象深刻。它现在可用于防御性代码扫描,但大多数人仍不能简单地提示模型。鉴于其网络安全能力,我可以理解这一推理。但这种策略有多持久?我们同时看到像Kimi K3这样的开放权重模型迅速接近前沿。架构、训练效率、合成数据、蒸馏、后训练和推理都在同时变化。没有理由假设复制特定能力将继续需要复制首先展示该模型。所以想象一下,Mythos仍然严格管控,但六或十二个月后,其他实验室——或匿名团体——发布了具有相当网络能力的不受限权重。一旦这些权重在全球传播,限制对Mythos的访问就不再限制Mythos能做的事。Anthropic本身似乎也认识到这一点:Project Glasswing明确是为了在能力扩散之前给防御者一个先机。这很有道理,但它提出了一个基本政策问题:当我们实际上需要认识到这些是争取时间的少数方法之一时,我们是否将模型访问控制视为永久安全解决方案?如果足够强大的能力最终会扩散到无人能集中控制的模型中,那么或许长期安全问题从“我们如何防止人们访问危险智能?”转向“我们如何使我们的系统和社交对这种智能的存在具有鲁棒性?”我不是在论证危险的前沿模型应该简单地发布。我在问如果能力扩散最终不可避免,真正的安全边界必须移向何处?想法?嗯。也有可能存在一个相反的长期可能性:如果一个行为者实现了足够大的智能优势,前沿可能根本不会扩散。但那似乎是一个单独的问题...
查看原文

相似文章