AI Security Leaderboard:对模型鲁棒性进行基准测试 [P]
摘要
作者介绍了AI Security Leaderboard,该排行榜通过让模型接受1500次自动化越狱尝试来评估前沿模型的鲁棒性,突出了各模型在安全性上的差距,并邀请社区就方法和后续步骤提供反馈。
我们开发了一个对前沿模型安全性进行排名的排行榜。模型能力排名并不缺乏,但我们在模型安全性方面没有找到类似的排行榜。然而,安全性对部署决策变得越来越关键:从美国政府要求开发者因网络安全越狱而下架模型,到开发者因对抗性攻击风险而推迟AI智能体的部署。我们开发了一个自动化测试套件,让模型接受1500次自动生成的越狱尝试,并测量通用越狱的数量:即能够对某个领域(如进攻性网络安全)内超过75%的明显有害问题引出合规、详细回答的提示词。在我们的技术报告中,我们发现最鲁棒和最不鲁棒的模型之间存在巨大差距。这是v1.0版本,我们非常希望从本subreddit获得关于后续步骤的意见,以及关于方法的反馈。
我们正在考虑的方面包括:
1. 添加开放权重模型。由于开放权重模型通过扰动权重(如refusal abliteration、有益性微调)天然具有更大的攻击面,如何公平地将它们与专有模型进行比较?
2. 在CBRNE和网络安全之外增加新领域,例如智能体劫持或有害操控。
3. 提高领域的真实性,例如使用智能体网络任务而非具体问题。
4. 更强的攻击:我们旨在让初始版本保持相当基础的攻击,但可以添加更强大的自适应优化攻击,如边界点越狱。
我们也希望听到你们认为我们如何能让这个基准在你们的工作中更有用的建议。如果你是对抗鲁棒性研究人员,是否有你希望重复使用的工件(如数据集或评估标准)?
相似文章
Gate AI:LLM安全基准评估方法与结果
本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。
StealthBench:衡量自主攻击性安全代理的操作隐蔽性
StealthBench 通过六个 OPSEC 维度,使用由三个模型组成的 LLM 评审小组,衡量自主攻击性安全代理的操作隐蔽性。结果显示,没有任何模型的安全成功率超过 54%,表明存在系统性的 OPSEC 失败。
由 AI Explained 和 Pablo Romero 提出的 Integrity Bench - 测量模型的过度自信程度
Integrity Bench 是由 AI Explained 和 Pablo Romero 开发的一个基准测试,用于测量前沿AI模型对自身能力的过度自信程度,帮助量化AI系统中这一常见问题。
)
Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。
评估先进AI的潜在网络安全威胁
DeepMind发布了一个综合框架,用于评估先进AI模型的进攻性网络安全能力,分析了遍布20个国家的12000多次真实AI驱动的网络攻击,并创建了涵盖整个攻击链的50个挑战基准,帮助防御者优先配置安全资源。