“安全AI”是什么样的?[D]
摘要
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。
对于开放权重的大语言模型(LLM),研究针对发布后微调(这会削弱拒绝或安全行为)的防御有多实用?我注意到新模型发布后很快就会出现“未审查”或“异端”变体,这引发了一个我好奇的问题:对于开放权重发布,抵抗微调是否是一个有意义的的安全目标,还是说它太狭隘了,因为坚决的用户总是可以修改权重、切换模型或使用其他变通方法?更进一步说,如果只需30分钟和一个自动化脚本就能攻破模型,当前的安全训练是否还值得投入成本和精力?我不是在问具体方法,只是问威胁模型。什么才算是有用的实际成果?例如,增加攻击者的成本或使安全移除更不可靠是否有价值,即使完美防止是不可能的?好奇人们从模型发布、治理和人工智能安全的角度如何看待这个问题。
相似文章
攻击比防御成本更低:我对开放权重模型的疑虑
对开放权重AI模型的怀疑观点,认为深度伪造、骚扰和恐怖分子滥用等安全风险可能超过收益,因为开放权重缺乏控制点,且攻击比防御成本更低。
超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。
工具规范至关重要:揭示并缓解AI代理中的安全风险
本文指出,模式化(schema-formatted)工具规范是AI代理安全性能下降的主要来源,会削弱大语言模型的拒绝信号。作者提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行分离,使有害请求的拒绝率从23.8%提升到70.6%,并将提示注入攻击的成功率从25.6%降至2.5%。
具体的AI安全问题
OpenAI、伯克利和斯坦福的研究人员共同撰写了一篇基础性论文,指出了现代AI系统中的五个具体安全问题:安全探索、对分布偏移的鲁棒性、避免负面副作用、防止奖励黑客和可扩展的监督。
AI安全争论聚焦于错误的边界
本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。