标签
Anthropic指控Alibaba创建了数万个虚假的Claude账户用于蒸馏攻击,导致更严格的安全限制,影响了合法用户。
本文警告称,当前及未来的人工智能模型显著降低了制造生物武器的门槛,引用了对开放权重模型的蒸馏攻击以及无法防止安全消融的问题。文章呼吁公共资金资助广谱应对措施作为必要回应。
本文研究了模型输出可能引发模仿的蒸馏攻击,提出了一个极小极大博弈框架和一种名为Product-of-Experts的仅前向传递防御方法,结果表明自适应学生模型能恢复的能力远超被动评估所显示的水平。