@pilvar222: 天哪:@AikidoSecurity 提前拿到了 GPT-6 Astra,在我们的网络安全基准测试上跑了一把,碾压了其他所有模型……

X AI KOLs Timeline 模型

摘要

Aikido Security 在网络安全数据集上对 GPT-6 Astra 进行了基准测试,在 pass@3 条件下重新发现了 32 个 CVE 中的 29 个,创下了史上最高召回率,比 GPT-5.6-Sol 还多出 4 个;不过三次评测运行花费了近 4000 美元。

天哪:@AikidoSecurity 提前拿到了 GPT-6 Astra,在我们的网络安全基准测试上跑了一把,碾压了其他所有模型! - 在 pass@3 下,它重新发现了 32 个 CVE 中的 29 个,创下了我们有史以来的最高召回率,比 GPT-5.6-Sol 多出 4 个 - 即使在 pass@1 下,召回率也达到 75%。该模型表现非常稳定 - 但这样的性能也付出了高昂的代价(字面意思)。三次运行花费了我们近 4000 美元 Astra 现在在我和 @iminurputer 搭建的基准测试中排名第一,而且遥遥领先 1/3 🧵
查看原文
查看缓存全文

缓存时间: 2026/09/06 20:54

天哪!@AikidoSecurity 提前拿到了 GPT-6 Astra,并在我们的网络安全基准测试中进行了测试,它碾压了所有其他模型!

  • 在 pass@3 下,它重新发现了 29/32 个 CVE,这是我们记录到的最高召回率,比 GPT-5.6-Sol 还多出 4 个
  • 即使在 pass@1 下,召回率也达到 75%。该模型非常稳定
  • 然而,这样的性能付出了高昂的代价(字面意义上的)。三次运行花了我们将近 4000 美元

Astra 现在在我和 @iminurputer 搭建的基准测试中排名第一,而且遥遥领先

1/3 🧵

Astra 还发现了一个我们评估过的所有其他模型都遗漏的漏洞!

这个漏洞需要追踪攻击者控制的数据在组件间解析时的流向,并发现应用实际处理过程与其周边安全检查之间的解析器差异。

其他模型也探索了相同的代码,但没能发现这一点。

该模型展现出了明显的智能提升。

2/3 🧵

这个模型基本已经刷爆了我们对真实世界高难度漏洞的基准测试。几乎一个都没漏。

@OpenAI 这次真的封神了。

了解更多关于我们的基准测试:https://aikido.dev/blog/ai-model-benchmarks-aug-21-2026…

在你的代码上运行我们的 Agent:https://aikido.dev/code/code-audit

3/3 🧵

还有一件事:

我们刚发布了一种简单的方法,可以在你的 PR 上运行这个!

持续安全 > 一次性扫描

我们在 GTA 6 出来之前就拥有了一个 CVE 工厂

不过下次迭代我们可能会准备一个更难的数据集,并增加 pass 次数

🤣

这个模型其实已经很接近那三个了,但没能像其他模型那样找到完整的可利用路径

我们在 Daybreak 中测试的,但我觉得模型在仅做检测时,安全限制通常比较宽松

这取决于模型,我们会权衡成本/性能/pass@n 的最佳比例。OpenAI 的模型跑在 high 档位,因为 high 到 xhigh 的成本差异莫名极高,性能提升却微乎其微;3 个 high 档位的 agent 远比 2 个 xhigh 档位的要好

这绝对是高端配置,虽然有些企业预算非常充足

想象一下他能用 Astra 找出多少恶意软件

全都在这儿了!

是的,有道理。我们确实会用不同设置跑单次 pass,然后决定这里展示什么。我们不想让可视化界面被太多数据弄得太乱,很快会有一个网站展示更多数据 :)

是的,不过我觉得只要提示词给得对,在仅做检测时安全限制还是挺宽松的。不过它确实会阻止任何创建漏洞利用的尝试 😅

确实!真的令人印象深刻

绝对是惊人的,没错

确实,财务团队马上要找我问话了 😆

😂

是啊,太厉害了

好在在代码中找问题时安全限制还挺宽松的,只要你不要求生成漏洞利用

不过我们是用 Daybreak 权限跑的,所以简单多了 :)

👀

我们是 Daybreak 的成员,但 OpenAI 的安全限制在漏洞“检测“这部分通常相当宽松

不过它确实会阻止任何创建漏洞利用的尝试

你不会想看那个账单的🤣

这就是他们说的“进入 AGI 时代“的意思吧

其实效率很高,但模型本身太贵了

希望很快能普及!

预算充足的企业😄

它确实是当下更划算的选择,尤其是在大型代码库上

相似文章

安全概览: GPT-6 Astra

OpenAI Blog

OpenAI 发布 GPT-6 Astra,这是其能力最强的模型,具备关键网络安全能力,拥有增强的安全措施、改进的鲁棒性和更好的对齐,与之前的模型相比。

GPT‑6 Astra

Simon Willison's Blog

OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。