后神话时代的网络安全:保持冷静,继续前行
摘要
本文批评了围绕虚构AI模型Mythos的炒作,认为其对网络安全的影响被夸大了,现有安全实践在面对现实威胁时仍然有效。
暂无内容
查看缓存全文
缓存时间: 2026/06/27 15:52
# 后神话时代的网络安全:保持冷静,继续前行!
来源:https://cephalosec.com/blog/cybersecurity-in-the-post-mythos-era-keep-calm-and-carry-on/
CISOned 观点 (https://cephalosec.com/tag/cisoned/)
随着围绕 Mythos 的那些恐惧、不确定性和疑虑开始变得真实,我们又能做些什么呢?矛盾的是,我认为我们多年来一直在做的事情几乎不需要改变。
在 Claude Mythos Preview 发布之后,我看到了网络安全领域许多激烈的争论。它被宣称是该领域的一场游戏规则改变者,遥遥领先于同类模型,并打开了全自动狩猎和利用零日漏洞的潘多拉魔盒。
此后,Mythos 及其安全防护更重的对应版本 Fable 5 发布,但很快又被下架。让我们借此机会反思一下这个模型带来了什么,以及它对行业的影响有多大。
---
### 恐惧、不确定性和疑虑为网络安全行业火上浇油
Anthropic 在公关中一直偏爱戏剧性的措辞。每一次重大模型发布都伴随着对其安全性的担忧;呼吁在到达不归点之前进行监管或暂停研究。Mythos 也不例外于这一趋势,它在四月份被披露,但并未公开发布 (https://www.nytimes.com/2026/04/07/technology/anthropic-claims-its-new-ai-model-mythos-is-a-cybersecurity-reckoning.html?ref=cephalosec.com)。相反,他们宣布了 Glasswing 项目 (https://www.anthropic.com/glasswing?ref=cephalosec.com),限制只有 50 个组织可以访问该模型,后来扩大到了 150 个实体 (https://www.anthropic.com/news/expanding-project-glasswing?ref=cephalosec.com)。这些幸运儿中的一些证实了 Anthropic 的危言耸听。他们宣布因 Mythos 发现了数百个漏洞。关于这个话题最有影响力的文章之一是英国政府的 AI 安全研究所的评估 (https://www.aisi.gov.uk/blog/our-evaluation-of-claude-mythos-previews-cyber-capabilities?ref=cephalosec.com)。Mythos 是第一个成功完成“专家级任务”的模型。它也是第一个在“The Last One”(一个从侦察到完全接管网络的整个攻击链的网络安全演习)中取得成功的模型。
仔细阅读文章会描绘出一幅不那么戏剧性的画面。虽然相比以前的模型有所进步,但这一领域的进展非常缓慢。我们可以看到 GPT-5.4,甚至 Opus 4.6,在高级 CTF 挑战赛上并没有落后太远。在网络安全演习方面,Opus 也是如此。这些基准测试也可能与真实的企业环境相去甚远,至少对于拥有成熟网络安全计划和专用 SOC 的公司来说是这样。正如文章强调的那样,“**它们缺乏通常存在的安全特性,例如主动防御者和防御工具。该模型采取触发安全警报的操作也不会受到任何惩罚。**”毫无疑问,这样的模型在执行侦察任务或潜入目标信息系统时,有时会非常嘈杂和笨拙。
“当然,但是模型可以离线找到的所有那些关键漏洞呢?攻击者可能会将它们用作强大的零日漏洞,”你可能会问?这方面是 Glasswing 项目的主要营销卖点,例如“OpenBSD 中一个 27 年历史的漏洞”或“FFmpeg 中一个 16 年历史的漏洞”。
安全专业人士读到这样的声明可能会发笑。突出一个已经存在很长时间的漏洞是 CVE 公告中非常常见的点击诱饵技巧,仅次于经典的“CISA 命令联邦机构修补 X”。在拥有数十万行代码的开源产品中,存在几十年的漏洞并不少见。大多数情况下,这只是意味着之前没有足够熟练的人看过这个区域。旧漏洞更有价值,因为它们影响更多版本的支撑软件,但这与最初发现它们的难度无关。然而,确实是,AI 辅助发现将增加它们的普遍性。
### Mythos 只是旧模型的渐进改进?
Mythos 最大的变化是那些财力雄厚的组织能够进行彻底搜索的可扩展性潜力。来自 Anthropic 红队的博客文章 (https://red.anthropic.com/2026/mythos-preview/?ref=cephalosec.com) 提供了更多关于他们如何取得如此成果的见解,这肯定是昂贵的。该模型被多次单独运行在大多数源代码文件上。他们通过其脚手架运行了一千次才得到 BSD 漏洞,成本大约为 20,000 美元。整个 Glasswing 项目分配的令牌预算价值一亿美元。这会带来新的风险吗?是的,但对于那些可能本来就拥有先进网络安全资源的行动者来说是这样,而不是普通的脚本小子。
如果早期的模型也受益于同样彻底的实验,它们可能已经发现了其中一部分漏洞。很难进行同水平的比较,因为 Anthropic 给出的关于 Mythos 如何运行(或者每个发现运行了多少次)的细节很少。有些人尝试以公平但更经济高效的替代方案复制这个概念 (https://swelljoe.com/post/will-it-mythos/?ref=cephalosec.com),并取得了一些探索性的结果。简而言之:在缺少 Mythos 甚至 Opus 模型的情况下,DeepSeek 在云托管世界中表现尚可,而 Gemma 4 和 Qwen 3.6 在可自托管类别中表现远超其体量,发现了基准测试中 Mythos 发现的大约一半漏洞。
然而,我不会像 Aisle 那样声称秘诀在于脚手架而非模型本身 (https://aisle.com/blog/ai-cybersecurity-after-mythos-the-jagged-frontier?ref=cephalosec.com)。虽然他们确实也使用小得多的 LLM “检测”到了许多最初由 Mythos 发现的漏洞,但这些模型都没有能力制作出有效的漏洞利用。不仅能够发出警报,而且能够实际证明可利用性 (https://thezvi.substack.com/p/claude-mythos-2-cybersecurity-and?open=false&ref=cephalosec.com#%C2%A7is-this-new) 绝对是只有 Mythos 类模型才拥有的优势。这似乎也解决了早期 AI 主导的漏洞狩猎的最大缺点之一:误报。这在他们的 Glasswing 项目初始更新中有所指出 (https://www.anthropic.com/research/glasswing-initial-update?ref=cephalosec.com),Mozilla (https://arstechnica.com/information-technology/2026/05/mozilla-says-271-vulnerabilities-found-by-mythos-have-almost-no-false-positives/?ref=cephalosec.com) 声称在其发现的 271 个漏洞中误报率极低。同样,Cloudflare 将误报率描述为“比人类测试人员更好”。只有时间(和更广泛的访问)才能证明这些说法是否属实。否则,普通组织在使用该工具时将不可避免地淹没在网络安全噪音的海洋中。
### OpenAI 奋起直追,美国政府则阻碍 Anthropic 的进程
在这场混乱中,我们意外地得到了美国政府的“喘息”,他们决定阻止所有非美国公民(包括在美国境内的非公民)使用 Fable/Mythos。这个不可能完成的任务迫使 Anthropic 完全关闭了该产品。没有人知道这会持续多久。
顺便说一句,看着 Anthropic 自食其果(多年来他们一直在播种:更多政府介入以控制使用和减缓 AI 竞赛)具有一定的讽刺意味。这是以最直白的方式实现的。
与此同时,OpenAI 在这一领域继续取得进展,推出了 GPT5.5-Cyber 和 Codex Security 插件 (https://openai.com/daybreak/codex-security-plugin/?ref=cephalosec.com)。他们有与 Glasswing 相当的项目,“Daybreak (https://openai.com/daybreak/?ref=cephalosec.com)” 和 “Patch the Planet (https://openai.com/index/patch-the-planet/?ref=cephalosec.com)”,但降低了恐惧宣传的调门,专注于防御者方面。这也是一个受控发布,可能是不想招惹美国监管机构。可以假设,在 Anthropic 的情况稳定下来或者非美国竞争对手填补空白之前,他们不会将这些产品开放给所有客户。我忍不住觉得这种方法令人沮丧。普通公司无法访问 5.5-Cyber,但大型网络安全公司可以,然后只以高价卖回给自己的客户。换句话说,这是以负责任部署为借口的人为稀缺性。
让我们利用这次放缓来重新集结,专注于在风暴再次来临前我们能做些什么来坚守阵地。
### 更新(2026-06-27):
事情发展很快。OpenAI 正在发布一个新的模型系列:Sol, Terra 和 Luna (https://openai.com/index/previewing-gpt-5-6-sol/?ref=cephalosec.com),其公关重点是其网络安全能力,并将其与 Mythos 进行比较。与 5.5-Cyber 一样,该模型被偏向于防御而非构建漏洞利用。这些安全措施似乎不足以满足美国政府的要求,他们仍然想要审查哪些机构能够访问新模型 (https://www.washingtonpost.com/technology/2026/06/26/openai-says-us-government-will-vet-users-its-latest-ai-model/?ref=cephalosec.com)。现在同样适用于 Anthropic,他们开始向一百家美国机构开放 Mythos (https://www.semafor.com/article/06/27/2026/us-releases-powerful-anthropic-model-mythos-to-some-us-companies?ref=cephalosec.com)。
---
随着这些恐惧、不确定性和疑虑开始变得真实,我们又能做些什么呢?矛盾的是,我认为我们多年来一直在做的事情几乎不需要改变。
### “我们家里已经有 AI 了”
我们这些凡人可能无法访问 Mythos 和 ChatGPT 5.5-Cyber,但现有的东西也并非完全无用。在 Anthropic 方面,Opus 4 仍然非常有能力,同样,对于那些能够获得必要批准的公司,GPT-5.5 与 Codex Security 插件也是如此。在开源方面,像 Strix (https://github.com/usestrix/strix?ref=cephalosec.com) 这样的脚手架已经可以实现很多功能,无论是结合本地模型(如 Qwen/Gemma)还是基于 API 的推理提供商(用于更强大的模型,如 DeepSeek 和 GLM)。
### 继续做好你的漏洞管理计划
多年来,CVE 发布的速率一直在全面稳步增加。它没有等到 Mythos 才失控。我还没有看到哪个公司能在有动机的攻击者将其武器化为漏洞利用之前,修补每一个有意义的漏洞。除了增加资源和优先级的明显调整旋钮外,我们现在“别无选择,只能做出选择”,理想情况下是好的选择。分类和情境化优先级划分是保持漏洞管理可持续的关键,这也是 AI 辅助可能发挥优势的领域。来自主要提供商的现有“漏洞评分”通常缺乏来自我们自身信息系统的情境化。他们可能知道一个漏洞在理论上有多糟糕,是否有漏洞利用可用,以及受影响的软件是否存在于我们的环境中。然而,他们通常忽略其他关键方面,比如它是否业务关键、是否易于访问、或者是否受到补偿控制的保护。理解海量不一致的文本和表格数据正是大型语言模型可以大显身手的地方。
### 减少攻击面
保护自己免受漏洞侵害的最佳方法是首先不拥有它。关闭不需要的东西是一种众所周知的安全加固技术,但说实话,在除了最成熟的企业环境之外,这种方法远远没有得到充分利用。近年来,随着微服务以及更一般地基于容器的基础设施的兴起,生活变得更容易了。如果你还没有研究过这个领域,我建议你从提供最小化(也称为“无发行版”)容器的项目开始,比如原始的 Google 项目 (https://github.com/GoogleContainerTools/distroless?ref=cephalosec.com)、Docker 加固镜像 (DHI) (https://docs.docker.com/dhi/?ref=cephalosec.com) 或用于 Kubernetes 的 Talos Linux (https://github.com/siderolabs/talos?ref=cephalosec.com)。Windows 方面有“Server Core” (https://learn.microsoft.com/en-us/windows-server/administration/server-core/what-is-server-core?ref=cephalosec.com) 作为一个不那么极端的变体。
### 给网络安全“洋葱”增加更多层,让 LLM 去剥
纵深防御方法比以往任何时候都更加重要。如果任何守卫边界的安防工具随时可能被零日漏洞攻破,那么在关键路径上设置额外的检查点以减缓入侵速度至关重要。举几个例子,你可以为 VPN/网络分段添加上下文感知代理和特权访问管理网关,为所有身份验证尝试添加抗钓鱼 MFA 等。
另一个值得重新审视的纵深防御策略是诱饵系统,如蜜罐和金丝雀令牌。如果我们从其他领域泛化 LLM 的行为,我们只能假设早期的 AI 入侵模型在其方法上是笨拙、嘈杂和天真的,因此非常可能触发这些陷阱。
### 零信任来救援
以上几点都可以被封装到一个更全面的零信任原则计划中:明确验证、使用最小权限访问和假设被攻破。在 Google 的 BeyondCorp (https://cloud.google.com/beyondcorp?ref=cephalosec.com) 十五年后,这些原则已经有了人人都能使用的技术实现,大多数 SASE 供应商都提供了他们自己的概念变体。上下文感知代理,也称为零信任网络访问网关,通常可以在允许接触到目标系统之前强制执行预先认证。如果你的软件容易受到未经身份验证的 RCE 攻击,但如果攻击者一开始就无法到达该服务,那就没多大关系。
这种心态不仅应适用于技术控制,也应适用于任何涉及人员流程。AI 极大地增加了社会工程学攻击的潜力,使得生成令人信服的消息或冒充关键人员(甚至包括音频和视频)变得轻而易举。如果你的客户服务或帮助台团队没有针对这些新能力进行适当培训,那么明确验证可能变得极具挑战性。
---
## 总结
Mythos 的网络安全实力是真实的。从以前模型的进步可能比最初公关所暗示的更线性,但改进无疑是巨大的,尤其是在生成可工作的漏洞利用方面。让我们保持冷静,利用 Mythos 可用性意外暂停的机会重新集结,优先处理正确的项目。任何降低漏洞被利用可能性的措施都值得采纳:
- 不要将 LLM 的排他性交给攻击者,有很多领域我们可以利用 AI 进行防御,从事件响应支持到基于代理的安全审查。
- 通过改进漏洞管理流程(特别是情境感知的优先级划分和分类)来缩短修补重要漏洞的时间。
- 减少攻击面,无论是已部署的内容(精简我们的服务器镜像),还是可访问的内容(通过零信任网络访问强制执行预先认证)。
- 在部署服务时继续采用零信任心态:假设被攻破、明确验证和遵循最小权限原则。
- 在路径上设置陷阱,让 AI 辅助的攻击者落入其中并提醒你的 SOC。LLM 有很多偏见,它们倾向于反复使用相同的技术,并且在其方法中可能极其天真,让我们利用这一点!
Mythos 并没有
相似文章
@Dan_Jeffries1: 终于有一篇关于Mythos的半有用读物,不涉及神话,而是更实际地谈论这意味着什么(不是……
Dan Jeffries评论了Cloudflare对Anthropic的Mythos的测试,认为真正的讨论应聚焦于针对AI驱动的攻击的实际安全改进,并且如果团队调整工作流程,AI最终会让软件更安全。
关于被热炒的网络模型(mythos/5.5)的有趣文章:你需要知道的那些震撼华盛顿的人工智能模型
本文讨论了那些不负众望、震撼华盛顿的网络模型(mythos/5.5),重点介绍了它们对政府和政策的影响。
@heyshrutimishra: We've been watching the wrong AI story. While the timeline keeps debating whether Mythos is real, hyped, or just well-m…
A thread contrasts the hype around AI security startup Mythos with 360's practical achievement of autonomously discovering 23 vulnerabilities (including two criticals) in the OpenClaw ecosystem, highlighting the real direction of AI security.
它能媲美Mythos吗?
作者测试其他AI模型是否能匹配Mythos在寻找安全漏洞方面的卓越能力,建立了一个由Mythos发现的漏洞基准,并测试了像Opus这样的模型。初步结果表明Mythos可能具有独特的能力。
Cloudflare警告:在AI巨头G20简报之前,Mythos AI能构建真实网络攻击
Cloudflare对Anthropic的Mythos Preview的测试显示,该模型能够将多个低严重性漏洞串联成可用的利用代码,这是进攻性网络安全AI的一大步,同时Anthropic正准备向G20官员简报相关风险。