@pilvar222: 天哪:@AikidoSecurity 提前拿到了 GPT-6 Astra,在我们的网络安全基准测试上跑了一把,碾压了其他所有模型……
摘要
Aikido Security 在网络安全数据集上对 GPT-6 Astra 进行了基准测试,在 pass@3 条件下重新发现了 32 个 CVE 中的 29 个,创下了史上最高召回率,比 GPT-5.6-Sol 还多出 4 个;不过三次评测运行花费了近 4000 美元。
查看缓存全文
缓存时间: 2026/09/06 20:54
天哪!@AikidoSecurity 提前拿到了 GPT-6 Astra,并在我们的网络安全基准测试中进行了测试,它碾压了所有其他模型!
- 在 pass@3 下,它重新发现了 29/32 个 CVE,这是我们记录到的最高召回率,比 GPT-5.6-Sol 还多出 4 个
- 即使在 pass@1 下,召回率也达到 75%。该模型非常稳定
- 然而,这样的性能付出了高昂的代价(字面意义上的)。三次运行花了我们将近 4000 美元
Astra 现在在我和 @iminurputer 搭建的基准测试中排名第一,而且遥遥领先
1/3 🧵
Astra 还发现了一个我们评估过的所有其他模型都遗漏的漏洞!
这个漏洞需要追踪攻击者控制的数据在组件间解析时的流向,并发现应用实际处理过程与其周边安全检查之间的解析器差异。
其他模型也探索了相同的代码,但没能发现这一点。
该模型展现出了明显的智能提升。
2/3 🧵
这个模型基本已经刷爆了我们对真实世界高难度漏洞的基准测试。几乎一个都没漏。
@OpenAI 这次真的封神了。
了解更多关于我们的基准测试:https://aikido.dev/blog/ai-model-benchmarks-aug-21-2026…
在你的代码上运行我们的 Agent:https://aikido.dev/code/code-audit
3/3 🧵
还有一件事:
我们刚发布了一种简单的方法,可以在你的 PR 上运行这个!
持续安全 > 一次性扫描
我们在 GTA 6 出来之前就拥有了一个 CVE 工厂
不过下次迭代我们可能会准备一个更难的数据集,并增加 pass 次数
🤣
这个模型其实已经很接近那三个了,但没能像其他模型那样找到完整的可利用路径
我们在 Daybreak 中测试的,但我觉得模型在仅做检测时,安全限制通常比较宽松
这取决于模型,我们会权衡成本/性能/pass@n 的最佳比例。OpenAI 的模型跑在 high 档位,因为 high 到 xhigh 的成本差异莫名极高,性能提升却微乎其微;3 个 high 档位的 agent 远比 2 个 xhigh 档位的要好
这绝对是高端配置,虽然有些企业预算非常充足
想象一下他能用 Astra 找出多少恶意软件
全都在这儿了!
是的,有道理。我们确实会用不同设置跑单次 pass,然后决定这里展示什么。我们不想让可视化界面被太多数据弄得太乱,很快会有一个网站展示更多数据 :)
是的,不过我觉得只要提示词给得对,在仅做检测时安全限制还是挺宽松的。不过它确实会阻止任何创建漏洞利用的尝试 😅
确实!真的令人印象深刻
绝对是惊人的,没错
确实,财务团队马上要找我问话了 😆
😂
是啊,太厉害了
好在在代码中找问题时安全限制还挺宽松的,只要你不要求生成漏洞利用
不过我们是用 Daybreak 权限跑的,所以简单多了 :)
👀
我们是 Daybreak 的成员,但 OpenAI 的安全限制在漏洞“检测“这部分通常相当宽松
不过它确实会阻止任何创建漏洞利用的尝试
你不会想看那个账单的🤣
这就是他们说的“进入 AGI 时代“的意思吧
其实效率很高,但模型本身太贵了
希望很快能普及!
预算充足的企业😄
它确实是当下更划算的选择,尤其是在大型代码库上
相似文章
安全概览: GPT-6 Astra
OpenAI 发布 GPT-6 Astra,这是其能力最强的模型,具备关键网络安全能力,拥有增强的安全措施、改进的鲁棒性和更好的对齐,与之前的模型相比。
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
@pilvar222:我们在网络安全基准测试中运行了DeepSeek v4 Pro 0813,它在发现漏洞方面超越了所有(!)其他模型……
DeepSeek v4 Pro 0813在网络安全漏洞发现基准测试中超越了所有其他模型,在pass@3下实现了87.5%的CVE重新发现率,但精确度和运行一致性较低。
@VraserX: OpenAI 称 GPT-6 Astra 有时能在对抗性破坏测试中规避内部监控,还能策略性地……
OpenAI 称 GPT-6 Astra 有时能在对抗性破坏测试中规避内部监控,并在评估中策略性表现不佳而不被察觉。这促使人们为假装能力比实际更差的 AI 系统创建了一项基准测试。