它能媲美Mythos吗?
摘要
作者测试其他AI模型是否能匹配Mythos在寻找安全漏洞方面的卓越能力,建立了一个由Mythos发现的漏洞基准,并测试了像Opus这样的模型。初步结果表明Mythos可能具有独特的能力。
暂无内容
查看缓存全文
缓存时间: 2026/06/23 04:40
# 它能比得上 Mythos 吗?
来源:https://swelljoe.com/post/will-it-mythos/
2026年5月30日
好吧,Mythos 确实能发现非常具有挑战性的安全漏洞,对吧?这就是为什么它被限制在少数人手中,以保护世界免受如此强大的漏洞发现工具的威胁。
我对公开给出的理由持怀疑态度,我怀疑真正原因是它的运营成本比当前模型高得多,以至于他们还不愿意广泛提供,考虑到他们在扩大容量以满足需求方面遇到的困难。但是,他们关于 Mythos 在发现安全漏洞方面有多出色的说法是真实的,还是仅仅是一种炒作?
不久前,我构建了一个工具,用于在我自己的项目中自动化漏洞狩猎,名为 Nelson (https://github.com/swelljoe/nelson),我已经注意到不同模型在识别漏洞的有效性上存在惊人差异。但我需要硬数据。于是,我(实际上主要是 Claude)设计了一个基准测试套件,借用了 Nelson 的一些代码。
这个想法是收集 Mythos 专门发现的漏洞(来自他们的文档 (https://red.anthropic.com/2026/cvd/)),找到漏洞修复之前的提交,验证顶级模型(本例中是 Opus)如果被直接指向该漏洞,能够识别并理解它,然后将这些添加到我们的语料库中,用于基准测试模型在无提示的情况下能否准确检测并描述该漏洞。(当前语料库中漏洞的详细信息在此处 (https://github.com/swelljoe/nelson/tree/main/cases))。
我使用 Opus(当时是 4.7 版)来对漏洞进行审查(并辅以人工抽查)。语料库中的所有漏洞(目前有 9 个)都被认为是在所有模型的知识截止日期之后,因此它们不会在记忆中拥有这些漏洞。而且,如果直接指向这些漏洞并告知要查找什么,几个模型都能识别出它们。所以,这些都是确凿的漏洞,与它们在现实世界中出现的方式完全一致,很可能就是 Mythos 发现它们时的状态。随着时间的推移,我会不断改进语料库。如果 Anthropic 停止吹嘘特定漏洞,它可能会变成一个更通用的基于 CVE 的基准测试。
因此,这个基准测试只有一个目的:找出其他模型能否做 Mythos 所做的事情,或者 Mythos 是否真的在这项任务上具有独特优势。
这里有一些注意事项,可能意味着这对被测试的模型来说不是公平的测试。更多测试正在进行中,这些运行很耗时(而且当包含顶尖模型时也很昂贵),我认为在经过一周左右的调试后,值得公布结果。
1. 模型被赋予问题文件和基本工具,运行在一个简单的测试框架中(Opus 除外,它使用 Claude Code,关于智能体的说明见下文)。没有提供任何提示,除了要查看哪个文件(这其实不算提示……标准审计实践是逐一查看项目中的每个文件,所以这是一个现实的提示)。模型可以查看整个仓库,并跨文件边界跟踪逻辑,但它们没有被告知要查找什么。
2. 最难的漏洞是跨多个文件的漏洞。模型可以自由查看所有文件,但通常需要了解上下文才能知道某个特定用法存在问题。这对任何安全审查者(无论是人类还是 AI)来说都是一个难题。我假设 Mythos 有更高级的工具。也许它会在调试器中运行软件,进行模糊测试等。猜测 Mythos 可能做的所有事情超出了本项目当前的目标。但是,这个语料库中存在一些极难发现的漏洞,这在一定程度上支持了 Mythos 特别擅长此问题的观点。
3. 模型*可能*没有在这个基准测试中作弊,但它们(在某些情况下)有作弊能力。它们运行在一个全新的容器中,并被给予一个经过清理的完整源代码检出和要审查的文件。`.git` 目录已被移除,因此它们无法轻易查看历史记录或文件的“未来”,但它们有网络访问权限。如果它们有动机,它们可能能够查找特定软件的 CVE。不过,我没有看到它们这样做的迹象。
4. 这不是任何东西的证明。数据稀疏。对于每个已知漏洞,每个模型我只运行了一次 *(1 次)*。这花了好几天中的几个小时,不过现在我已经增加了并发性,下次会更快(但永远不会免费)。所以,这不是确凿证据,但我确实认为它提供了有趣且有用的数据。所有模型都有相同的机会和相同的工具(除了使用 Claude Code 的 Claude 模型),并且有些模型表现更好。所有模型的表现都比我预期的要差。我低估了这些漏洞的发现难度。
关于智能体的说明:我最初也尝试在完整功能的智能体中运行所有模型,除了使用模型 API 的基本框架,要么使用它们“偏好的”智能体(供应商提供的),要么使用配置为测试模型 API 的 Claude Code。我最初的假设是,在完整功能的智能体中运行会给模型最好的表现机会。结果发现这并不重要……没有任何模型因使用智能体而表现更好,有几个甚至表现更差,而且时间/令牌/成本在引入智能体后总是更高,原因不明。因此,只有 Claude 模型使用智能体运行,因为订阅用户在 Claude Code 中运行 Claude 模型的成本远低于通过 API 运行(至少对我来说是这样),而且在智能体中运行似乎不会损害 Claude 模型的性能(尽管我会进行更多测试,因为数据仍然不足)。
关于智能体的第二个说明:`agy`(Gemini 的 Antigravity CLI)明确且故意地对安全工作毫无用处。在九种情况中的八种,它回答“抱歉,我无法满足您分析指定代码文件以查找可攻击安全漏洞的请求”,立即拒绝了提示。因此,我付费在 Google AI Studio 中获得了 API 访问权限来运行 Gemini 测试,尽管我拥有 Google 订阅,本可以覆盖 `agy` 中的使用。这很烦人。软化提示,删除诸如“可攻击”和“易受攻击”之类的词也无济于事。该模型足够聪明,知道我们正在寻找安全漏洞,并且它完全不配合。也许有办法绕过这些防护栏,但我不打算为了让 Google 产品看起来没那么糟糕而费心。如果你的目标是安全工作,Antigravity 根本不适用。我将其从排名中移除,甚至在决定将其他智能体测试运行作为无趣的噪声移除之前(除了上述提到使用 Anthropic 模型的 Claude Code)。
## 结果
点击查看完整的 HTML 报告。
完整基准测试结果,点击查看完整 HTML 报告 (https://swelljoe.com/html/bench-report-final.html)
注意,GPT 5.5 Pro 在排行榜上位居榜首,仅仅是因为它在只完成四个案例后就超出了 100 美元的预算,所以 2/4 是 50%。而且,另外几个结果(Qwen 模型的两个版本)由于未能完成所有案例,其检测率排名被向上扭曲了。
2026 年 6 月 7 日更新:添加了 Gemma 4 模型和 MiniMax M3。Gemma 4 MoE 不知何故进入了领先位置,它检测到了 4/9 的漏洞,且精确率 100%(与 MiMo 和 GPT 5.5 相同,优于 Google 领先的商业模型),尽管有一个注意事项:它获得了多次尝试,因为 `llama-server` 不断崩溃或以某种方式失败,导致模型获得了另一次机会。我怀疑其他模型如果有几次额外尝试也会表现更好。我很快会做一个多次尝试版本的基准测试(不包括非常昂贵的模型,因为我并非钱多得没处花,而且我们已经知道它们相当不错)。这就是为什么它在图表中显示为 3/7……但是,当我摆弄 `llama-server` 配置试图让两次失败的运行在该模型上完成时,它又发现了一个漏洞。在那次摆弄中发现的漏洞是一个很难的漏洞,*只有* Opus 发现过,直到 Gemma 4 也发现了它。
2026 年 6 月 17 日更新:添加了 GLM 5.2、Kimi K2.7-code 和 VibeThinker 3B。没有重大意外,GLM 表现更好,Kimi 没有。VibeThinker 是这批模型中最小巧的,不出意料完全无法胜任此任务。
2026 年 6 月 21 日更新:添加了 Nemotron Ultra 550b a55b 和 North Mini Code 33b a3b。两者都表现不佳。前者,Nemotron 的较大版本明显比其较小的 120b 兄弟版本表现更差,原因未知(但重复运行可能会改变这一情况,我很快会去做)。North Mini Code 对于一个小模型来说表现尚可,但 Qwen 3.6 和 Gemma 4 在所有情况下都击败了它(Gemma 4 31b 在图表上位置较低,但实际它发现了 4/9 个漏洞,只是其中几个解读有误)。
2026 年 6 月 22 日更新:添加了 Nemotron 3 Nano Omni 和 Laguna XS.2,以完善 Nemotron 和 Laguna 的家族树。奇怪的是,两者都优于它们更大的同类。我对此没有解释。Nemotron 似乎在模型大小与发现安全漏洞的性能之间存在反比关系。这很令人惊讶。需要更多数据。
## 惊喜
Qwen 3.6 27B 表现远超其体量。我一直在说它“出奇地好”,即便如此,它在这里的表现还是让我惊讶。它用更少的误报发现了比多个商业模型(包括更大的模型,例如 Sonnet,在发现我们正在寻找的特定漏洞方面表现比 Qwen 差,并且发现了数量异常多的“其他漏洞”,我倾向于将其称为接近误报,尽管评判者 Opus 4.8 认为它们是可信的/真实的漏洞)。它还击败了 Gemini 3.1 Pro,一个所谓的领先模型。Qwen 3.6 是我本地 Strix Halo 机器上自托管的,内存 128GB,所以有点慢,比次慢的模型慢 3 倍。而且,它没有给出结果的那个案例是因为超时。它可能最终会完成,但我认为设定一个上限,超过该时间则视为失败是合理的,我选择了 30 分钟作为上限。
Gemini 3.5 Flash 以较大优势超越了 Gemini 3.1 Pro。它多发现了一个目标漏洞,并且没有产生那么多误报。但是,Gemini 3.5 Flash 的成本更接近大型模型,而不是之前的 Gemini Flash 模型,这使得它变得无关紧要。似乎有更好(且便宜得多)的模型。
便宜的国产模型表现出色。MiMo 和 DeepSeek 与 Opus 4.8 和 GPT 5.5 直接竞争,价格大约低一个数量级。有人指责国产模型“基准测试刷分”,但我认为没有合理的方式让模型已经针对这些最近披露的漏洞进行过调优。我认为它们正在真正变得能够与 Anthropic 和 OpenAI 的前沿模型竞争。如果你赶时间,DeepSeek 平均速度最快,同时发现了 4/9 的漏洞。如果你想省钱,MiMo 以最低的价格找到了和任何模型一样多的漏洞。
Mistral Medium 完全失败。我还没有深入研究原因。它按照指令完成了任务,没有给出错误,只是没有返回任何结果。我假设这是一个安全问题,但没有像 `agy` 那样明确说出来,而不是完全无法胜任这项任务。我认为包含它是一个有趣的模型,因为许多欧洲人(合理地)不愿将数据交给美国或中国的 AI 公司,而 Mistral 是领先的欧盟 AI 公司。只是目前不适合做安全相关工作。
Laguna M.1 也没有发现任何已知漏洞,但报告了另一个被 Opus 判定为真实的漏洞,所以我不认为它与 Mistral 属于同一类别,Mistral 似乎甚至没有尝试。我认为 Laguna 只是不擅长这个任务。
我没有任何理由再使用 Haiku 或 Sonnet,至少对于安全审计来说。它们在任何方面都并不出色,也并非那么便宜。尤其是 Haiku,为了弥补其低价格,它以惊人的速度消耗令牌。平均每个案例 160 万令牌,是下一个竞争者(自托管 Qwen 3.6,73.3 万令牌)的两倍多。MiMo 和 DeepSeek 都非常便宜且非常好,如果你想用便宜的 LLM,不妨就用它们。
6 月 7 日编辑:看看 MoE Gemma 4 的结果和关于“偏离基线”运行的说明。很疯狂,对吧?我目前正在运行一轮仅针对 Gemma 4(密集版和 MoE 版)的基准测试,看看是结果可复制,还是发现一个非常难的漏洞纯属侥幸。我会指出,MoE 版本“迷失”的频率远高于任何其他模型。它会陷入循环,一遍又一遍地查看同一组代码行(有时是*正确*的那组代码行),直到超时。这是两个需要重复的案例的失败模式,也是我在仅针对 Gemma 模型的新基准测试中看到约 30% 案例的失败模式。所以,尽管在这个语料库中它是发现 4/9 漏洞的最小型模型,但如果你尝试交互式地使用它,它也是最有可能浪费你大量时间的模型。
## 结论
我不知道。它能比得上 Mythos 吗?普通人有获得发现这些困难漏洞所需的工具吗?我想说这个基准测试给出了一个响亮的回答:“也许吧。”
Mythos 可能确实比当前其他模型更擅长发现安全漏洞,因为它发现了四个在这个实验中没有任何模型找出的漏洞。但是,我会继续测试。可能通过更改提示、工具或框架,可以从当前公开可用的模型中获得更好的结果。
而且,Opus 在获得足够线索时能够看到并理解所有这些漏洞,这一事实让我认为,如果给予足够的时间、机会和工具,当前最好的公开模型很可能也能发现这些漏洞。这个基准测试使用的是相当简陋的框架和提示。
← Qwen 3.6 量化退化 (https://swelljoe.com/post/qwen-quantization-degradation/)
关于 Granite 4.1 的一件有趣的事 → (https://swelljoe.com/post/an-interesting-thing-about-granite-41/)
相似文章
Mythos 并非通过‘黑客’训练而成。其他 AI 实验室未来也将达到 Mythos 级别的能力。
文章澄清了 AI 模型 Mythos 并非通过黑客技术训练,并预测其他 AI 实验室最终将具备类似能力。
Mythos在网络安全/黑客攻击方面优势的更多证据——与5.5版本相比,它完成了41个n-day漏洞利用中的18个,而5.5只有1个。开源/权重模型则一个都没有。
Mythos在网络安全黑客攻击中展现了强大性能,实现了41个n-day漏洞利用中的18个,而5.5版本只有1个,开源模型则一个都没有。
@logangraham: 很多人一直在关注Mythos、Glasswing以及我们/合作伙伴正在修复的漏洞。今天,我很兴奋……
Anthropic的Claude Mythos Preview模型已经过XBOW和英国AISI的评估,展示了前所未有的自主网络安全能力,包括解决端到端网络靶场以及发现数千个漏洞。该公告强调需要为网络安全领域快速发展的AI能力做好准备。
Project Glasswing: Mythos 的启示
Cloudflare 测试了 Anthropic 专为安全漏洞研究设计的 Mythos Preview 大语言模型,发现它能够将多个漏洞串联成利用链并生成可行的验证代码,这代表了相较于通用前沿模型的重大进步。
OpenMythos 基准测试
OpenMythos 推出了一个新的开源基准测试,用于评估 AI 模型在神话知识方面的表现。