访问控制或许能争取时间,但无法实现永久控制。如果是这样,我们应该如何利用这段时间?
摘要
本文质疑了当能力不可避免地扩散到其他模型时,访问控制对AI安全的长期有效性,并建议转向构建健壮系统作为应对。
当限制对模型的访问不再限制其能力时,AI安全会怎样?Anthropic对Claude Mythos 5的方法令我印象深刻。它现在可用于防御性代码扫描,但大多数人仍不能简单地提示模型。鉴于其网络安全能力,我可以理解这一推理。但这种策略有多持久?我们同时看到像Kimi K3这样的开放权重模型迅速接近前沿。架构、训练效率、合成数据、蒸馏、后训练和推理都在同时变化。没有理由假设复制特定能力将继续需要复制首先展示该模型。所以想象一下,Mythos仍然严格管控,但六或十二个月后,其他实验室——或匿名团体——发布了具有相当网络能力的不受限权重。一旦这些权重在全球传播,限制对Mythos的访问就不再限制Mythos能做的事。Anthropic本身似乎也认识到这一点:Project Glasswing明确是为了在能力扩散之前给防御者一个先机。这很有道理,但它提出了一个基本政策问题:当我们实际上需要认识到这些是争取时间的少数方法之一时,我们是否将模型访问控制视为永久安全解决方案?如果足够强大的能力最终会扩散到无人能集中控制的模型中,那么或许长期安全问题从“我们如何防止人们访问危险智能?”转向“我们如何使我们的系统和社交对这种智能的存在具有鲁棒性?”我不是在论证危险的前沿模型应该简单地发布。我在问如果能力扩散最终不可避免,真正的安全边界必须移向何处?想法?嗯。也有可能存在一个相反的长期可能性:如果一个行为者实现了足够大的智能优势,前沿可能根本不会扩散。但那似乎是一个单独的问题...
相似文章
AI代理是否在我们学会如何控制它们之前就变得更有能力?
本文讨论了AI代理能力与生产环境所需控制机制之间日益扩大的差距,重点介绍了权限、升级和问责方面的挑战。
如果每个人都能使用相同的AI,人类的优势将转向何处?
作者探讨了随着AI变得更易于访问,人类优势如何演变,指出识别问题框架中的差距或被忽视的变量可能是关键。
你如何设计AI代理对工具、API和敏感数据的访问控制?
本文讨论了为AI代理设计访问控制的挑战和方法,重点是基于任务的权限和自动化治理。
@julien_c:“现有权力结构意识到,它们在人工智能动态中施加自身影响力的时间窗口有限——…
观察者指出,随着模型能力增强,现有权力结构影响人工智能发展的窗口期有限。
我们是否正从芯片出口管制转向模型访问控制?
讨论从基于硬件的出口管制转向限制访问预训练AI模型的潜在转变,问题从谁能开发前沿AI变为谁被允许使用它。