)
摘要
Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。
暂无内容
查看缓存全文
缓存时间: 2026/07/28 18:22
# DeepsecBench:评估模型在发现网络安全漏洞方面的性能
来源:https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities
上周,OpenAI 在隔离沙箱内对两个模型进行了漏洞利用基准测试。测试过程中减少了护栏,模型在其环境中发现了一个漏洞,访问了互联网,并进入了 Hugging Face 的生产数据库。
没有人类指导这些行动,但这次入侵清楚地表明,当攻击者配备强大的 AI 模型时,他们的能力会强多少。但防御者也拥有相同的工具,并且有一个明显的优势:对自己代码库的了解。黑客攻击是从外部发起的,所以最好的防御就是在攻击者之前从内部发现漏洞。
今天我们发布了 [DeepsecBench](https://vercel.com/ai-gateway/leaderboards/deepsecbench),这是一个评估不同模型在应用程序代码中发现网络安全漏洞能力的基准测试。对于每个模型,报告包括召回率、精确率、成本和总时间,并将召回率和精确率合并为一个基准评分。以下是来自排行榜的模型性能样本:
我们构建了 [deepsec](https://deepsec.sh/) 以使扫描尽可能简单。现在您可以使用基准测试报告来构建一个符合预算和代码库复杂性的安全扫描程序,选择正确的模型组合以及运行频率。
## [基准测试的工作原理](https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities#how-the-benchmark-works)
DeepsecBench 运行在一个开源代码库上,该代码库处于大量漏洞被修复之前的某个提交状态。我们选择了 50 个入口点文件,并构建了一个包含 231 个人工判定发现的黄金集。每个模型的评分是基于召回率的加权 F2(评分 = 100 × 5PR/(4P+R)),召回率 (R) 的权重是精确率 (P) 的两倍,因为漏掉的漏洞将得不到修复,而误报并不会降低代码库的安全性。
超出黄金集的发现由一个评判模型归类为真实或虚假,并在精确率度量中计入或扣除(召回率仅衡量那 231 个已知发现)。
基准测试运行三次,报告中发布的数据是三次运行的中位数。
基准测试的构建保持保密。我们不公开存储库、提交、文件或发现,因此模型无法进行训练。一个背诵已记忆修复的模型会获得接近完全的召回率。而实际上,最好的运行只找到了 30.7%,25 次运行中有 20 次低于 20%。
## [强大分析的成本正在下降](https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities#the-cost-of-capable-analysis-is-falling)
当我们 [介绍 deepsec](https://vercel.com/blog/introducing-deepsec-find-and-fix-vulnerabilities-in-your-code-base) 时,对生产代码库进行全面扫描需要使用最强大的模型,而且运行成本很高。OpenAI 和 Anthropic 的前沿模型仍然得分最高,但开放权重模型和更高效的推理选项正在缩小这一差距,使得全面扫描的成本效益大大提高。
基准测试中每次运行的模型得分与成本对比。越高且越靠右越好。在 DeepsecBench 页面可以交互并下载这些图表。
如今,更高的价格并不能买到相应的比例。来自 Moonshot AI 的 [Kimi K3](https://vercel.com/ai-gateway/models/kimi-k3) 在高级设置下以 12.38 美元的价格获得 17.56 的评分,排名第八,得分是最高分的一半,成本约为五分之一。设置为高级的 [Grok 4.5](https://vercel.com/ai-gateway/models/grok-4.5) 以不到一半的成本提供了接近 Kimi 的性能,仅花费 5.60 美元就获得了 15.58 的评分。设置为中级的 [GPT-5.6 Sol](https://vercel.com/ai-gateway/models/gpt-5.6-sol?__vercel_draft=1) 在表现最佳模型中提供了最佳的性价比,以 17.95 美元的成本获得 25.10 的评分,排名第五。
您可以与这些图表进行交互并在 [DeepsecBench 页面](https://vercel.com/ai-gateway/leaderboards/deepsecbench) 上下载它们。
Anthropic 最强大的模型 Fable 5 没有出现,因为它拒绝安全相关工作,包括防御性任务。当安全增强版本可用时,我们会将其加入基准测试。
基准测试中报告的成本涵盖 50 个文件。一个生产代码库的文件数量可能达到这个数量的 100 倍,一次全面扫描的价格大约在 1200 美元(Kimi K3 扫描)到超过 5000 美元(来自 OpenAI 的最高评分前沿模型)之间。
## [跨多个模型构建扫描程序](https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities#building-a-scanning-program-across-multiple-models)
由于安全扫描是重复性工作,问题在于哪个任务使用哪个模型以及何时使用。例如,前沿模型可用于定期深度审计,而 Kimi K3 或 Grok 4.5 等更便宜的模型则以更高的频率运行扫描。将 GPT-5.6 Sol 的推理级别从 xhigh 降至 medium,其评分从 35.58(3 小时 39 分钟)降至 25.10(仅 30 分钟多一点),足以在新功能推送到生产环境之前进行审查。
一家初创公司可能会在每个合并请求时使用 Grok 4.5 进行扫描,并将更昂贵的审计保留给里程碑版本。一家大型企业可能会对其关键服务进行前沿审计,在关键拉取请求上使用相同模型但降低推理级别,并在其余代码库上持续进行 Kimi 类或 Grok 的扫描。
## [通过一个端点运行基准测试](https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities#running-the-benchmark-on-one-endpoint)
安全扫描是突发工作负载,会在短时间内消耗大量令牌,这种突发容量很难直接从任何单个提供商处购买。每次 DeepsecBench 运行都通过 [AI Gateway](https://vercel.com/ai-gateway) 进行。网关为我们提供了一个到达每个模型的单一端点。在运行期间,路由、重试和故障转移会自动发生,无需管理每个提供商的密钥或速率限制。
我们用于基准测试的相同路由也可以运行您的安全扫描程序。将 `provider/model` 传递给 `deepsec`,并在您的环境中使用一个 `AI_GATEWAY_API_KEY` 即可覆盖排行榜上的所有模型(或者对于链接的 Vercel 项目,可以通过 OIDC 访问 AI Gateway)。
```
pnpm deepsec process --project-id my-app --agent pi --model xai/grok-4.5
```
使用 AI Gateway 平衡不同 deepsec 安全扫描的模型能力和成本。
## [首先发现你的漏洞](https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities#find-your-vulnerabilities-first)
攻击者可以使用 AI 模型,但他们从外部行动。防御者可以看到他们的整个系统:源代码、架构、历史。这种可见性使得相同的模型在您手中比在他们手中更强大,因为能够读取源代码的模型可以找到攻击者只能探测的东西。这个优势是真实的,但只有在您首先使用时才有效。
我们将继续随着新模型的发布和评测而更新 [DeepsecBench](https://vercel.com/ai-gateway/leaderboards/deepsecbench)。
**使用 deepsec 运行安全扫描** 使用 deepsec 和 AI Gateway 构建安全扫描程序。开始使用 (https://github.com/vercel-labs/deepsec/blob/main/docs/getting-started.md)
相似文章
@rauchg: 据内部评估,Kimi K3 在网络安全领域表现顶级。X 上有传言称 Moonshot 基准过拟合。这…
Vercel Labs 发布了 deepsec,一个开源的、基于代理的漏洞扫描器,它使用顶级 AI 模型按需审查大型代码库,并发现难以发现的漏洞。
有人对新DeepSWE进行了审计,结果不太好看
DeepSWE是一个新的基准测试,用于评估AI编程代理在来自活跃开源仓库的真实软件工程任务上的表现,包含113个任务,涵盖TypeScript、Go、Python、JavaScript和Rust,提供隔离环境和基于程序的验证器。
评估先进AI的潜在网络安全威胁
DeepMind发布了一个综合框架,用于评估先进AI模型的进攻性网络安全能力,分析了遍布20个国家的12000多次真实AI驱动的网络攻击,并创建了涵盖整个攻击链的50个挑战基准,帮助防御者优先配置安全资源。
EVMbench 介绍
OpenAI 和 Paradigm 推出了 EVMbench,这是一个用于评估 AI 代理在检测、修复和利用智能合约漏洞方面能力的基准测试,涵盖来自 40 次审计的 117 个精选漏洞。该基准测试显示 GPT-5.3-Codex 在利用任务上达到了 71% 的成功率,显著优于 GPT-5 的 33.3%,而检测和修复任务仍然更具挑战性。
AI安全排行榜:模型鲁棒性基准测试 [P]
介绍了一个用于对AI模型抵御安全威胁的鲁棒性进行基准测试的排行榜,提供标准化评估。