攻击比防御成本更低:我对开放权重模型的疑虑
摘要
对开放权重AI模型的怀疑观点,认为深度伪造、骚扰和恐怖分子滥用等安全风险可能超过收益,因为开放权重缺乏控制点,且攻击比防御成本更低。
重要提示:我对此没有定论。我理解开放权重的好处:摆脱大实验室的依赖、保护隐私、获取研究资源。但进展速度快到让一年前听起来像科幻小说的风险如今显得可信,我一直在想它们是否会超过好处。核心问题是,封闭模型有一个控制点:提供方可以看到查询并切断访问。而开放权重完全没有。安全训练只需一次廉价的微调就能被去除,而且你永远无法从互联网上召回一个文件。把能力向前推几年,想想最终谁会得到一件没有刹车的工具。一个跟踪狂或前任运行本地模型,生成针对性的骚扰和深度伪造内容。敲诈勒索变成一条流水线:从公开数据生成档案、捏造有损名誉的深度伪造内容、向一千名受害者并行发送个性化威胁——于是任何人都可能成为目标,包括你的孩子和他们在网上的照片。用你女儿的声音打诈骗电话,这今天已经能骗到老年人了。恐怖组织得到一位耐心的24/7顾问,用于宣传、招募,最坏的情况下还能在生物学等领域提供指导。流氓国家免费获得数十亿研发投入的成果,而我们却在谨慎地制裁硬件。我的主要问题其实是一个家庭问题:一个普通人如何保护自己所爱的人免受这些威胁?“运行你自己的防御模型”没有用,因为我家里的模型对别人那里用来攻击的模型毫无办法。在这里,攻击从根本上比防御更便宜,这不同于保护所有人平等的密码学。也许我遗漏了一些显而易见的东西。我知道那些反驳观点:恶意行为者无论如何都会获得能力;开放性促进安全研究;当年人们也对互联网和印刷机说过同样的话。也许十年后这些担忧会显得很天真。但我想向坚定的开放权重支持者诚心请教:这个推理的漏洞在哪里?我对自由与控制之争的兴趣较少,更想知道你们会如何回答“我该如何保护我的家人?”
相似文章
开放权重模型的权衡(9分钟阅读)
对开放权重AI辩论的分析:支持者认为它使AI民主化,而批评者则指出滥用风险;多家大型科技公司签署了支持开放权重的公开信,而Anthropic和特朗普政府的部分成员仍保持谨慎。
开源权重难以承受的廉价
讨论了开源权重AI模型变得极其廉价的趋势,使得先进的AI能力更加普及。
开源模型令人难以承受的廉价
本文探讨了像DeepSeek V4这样的开源模型与Anthropic和OpenAI的闭源模型之间的巨大成本差异,认为后者是通过人为稀缺性和品牌效应而非技术优势来维持高价格。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。
抱歉,但Dario刚才是不是在说闭源且保密的模型比开源模型更差?
Dario Amodei暗示闭源权重且保密的模型可能比开源权重模型更差,引发了关于AI透明度和安全性的讨论。