@daniel_mac8: https://x.com/daniel_mac8/status/2054994899422826592

X AI KOLs Following 新闻

摘要

该讨论串指出,有最新证据表明AI代理已基本实现自主运作,其中Claude Mythos成功解决了此前未破解的网络攻击模拟实例,并超出当前基准测试测量极限,显示出超指数级进步。同时强调了安全影响及机构应对措施。

https://t.co/IGchBnaJKt
查看原文
查看缓存全文

缓存时间: 2026/05/15 02:58

大事正在发生。它比你想象的更重大。

回想2026年2月。

@mattshumer_ 那篇广为流传的文章《大事正在发生》表达了一种感受:AI 开始真正发挥作用了。AI 真的在落地。就像新冠疫情初期一样,我们当时并未意识到这意味着什么。

几个月后,我们拥有的已不止是一种感受。

呈现在我们面前的是指数级的进步。

三个月前,证据还只是轶事性的:软件工程师休假了,几位知名人士注意到 AI 编程智能体确实能干活。他们向自己的受众讲述了这件事,浪潮开始涌动。像 @deanwball 这样聪明的头脑开始说 Claude Code + Opus 4.5 就是 AGI。

自那以后,证据已经变得系统化:AISI、METR、与 Anthropic 相关的联盟、网络安全团体、大规模的 AI 科学融资。

如果说 Matt 的文章是“我们看到天空中有 UFO”,那么这篇文章就是:

“外星人已经登陆。他们想和我们领导人对话。”

智能体变得不可否认

最近有两项结果表明,智能体已在很大程度上实现自主。

1. Claude Mythos 攻克 AISI 的完整网络攻击模拟

Claude Mythos 预览版是首个解决 AI 安全研究所(AISI)网络攻击模拟全部任务(在 6/10 的尝试中)的模型。“The Last Ones”是 Mythos 成功完成的网络测试之一,难度估计需要一名人类攻击者 20 小时。另一个名为“Cooling Tower”的网络攻击测试,Mythos 在 3/10 的尝试中成功完成,该任务此前未有任何模型攻克

2025年11月,AISI 网络测试任务持续时间的近似倍增时间为 8 个月。到 2026年2月,这一速度已加快至约 4.7 个月。Mythos 和 GPT-5.5 均领先于 4.7 个月的趋势线。

如果该趋势持续,AI 的任务持续时间(至少对于网络任务而言)将是超指数级的。模型能完成的任务越来越长,且改进的速度本身也在加快。

没有理由认为这种能力跃升仅限于网络任务。Anthropic 已确认 Mythos 是一个“新的通用语言模型”,并表示其网络能力“作为代码、推理和自主性方面普遍改进的下游结果而涌现”。

Anthropic 决定首先将 Mythos 提供给一个精选组织群体用于网络防御目的,因为这对社会最为重要。这种能力水平也应能推广到其他领域。没有理由相信它不会。

2. Mythos 突破 METR 测量上限

METR 衡量一个简单指标:一项任务需要熟练人类多长时间,以及 AI 智能体能否以给定的成功率完成该时长的任务。其“50% 时间地平线”是指智能体对人类专家需要该时长的任务有半数成功率。

Claude Mythos 预览版现已超越该测量的边界。METR 的最新更新加入了早期的 Mythos 结果,并警告称当前任务套件下,超过 16 小时的测量结果不可靠

这一点的有趣之处不仅在于“Mythos 能完成更长任务”,更在于我们的 AI 模型现在正超越我们进行基准测试的能力。我们开始用尽那些干净、可良好测量且足够长的任务来测试这些智能体。

AI 在几年内从**“能完成人类需要几分钟的任务”发展到“能完成人类需要几天的任务”**。至少如此。METR 表示测量结果已不可靠。

网络安全是最尖锐的现实测试案例,但 Anthropic 表示这种能力源于代码、推理和自主性方面的普遍改进。METR 的结果也证实了这一点。

智能体现在能够执行真实的、有经济价值的工作。它们正在快速变强。

智能体已变得不可否认。

如果好人拥有它们,这很棒。但如果坏人拥有,就没那么好了。

安全界的回应

这正是 Anthropic 没有直接将 Mythos 发布给所有人的原因。

相反,他们启动了 Project Glasswing:一个与 AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux Foundation、Microsoft、NVIDIA、Palo Alto Networks 等机构协调一致的努力,首先将 Mythos 用于网络防御。

请思考一下。

一家领先的 AI 实验室构建了一个通用模型,其能力如此之强,以至于能找到并利用软件漏洞,因此他们认为负责任的首次发布不是一个聊天机器人产品,而是一个安全联盟。有人批评此举纯粹是“营销噱头”。但如果广泛发布 Mythos 并持续增长收入,本会是更好的营销策略。

Anthropic 表示 Mythos 已经发现了数千个高危漏洞,包括每个主流操作系统和每个主流网络浏览器中的漏洞。其中一些漏洞相当古老。一个是 OpenBSD 中一个27年之久的漏洞。另一个是 FFmpeg 中一个16年之久的 bug,自动化测试工具已经运行了数百万次却从未捕获。

再说一次:Mythos 并非专门训练成网络武器。这些网络能力源于编码、推理和自主性方面的改进。

这正是应该让每个人脊背发凉的部分。

如果你有一个 AI 智能体,能够自主发现细微漏洞、串联漏洞、逆向工程二进制文件,并生成可用的利用代码,你就拥有了能够改变攻击者与防御者之间平衡的东西。

短期内,这是危险的。攻击者只需要找到一条路径进入。防御者则必须保护一切。如果像 Mythos 这样的模型在防御者准备好之前就广泛可用,坏人也能获得同样的杠杆。

但这也是为何其积极面如此之大。

首次,好人可能拥有一种工具,能够搜索大量关键软件,并在攻击者之前发现隐藏的裂缝。Anthropic 正在为 Project Glasswing 及额外参与者提供 1亿美元 的使用额度,并为开源安全组织提供数百万美元。

这就是为什么将强大的 AI 引导到正确方向如此重要。

它可以成为社会的真正福音,但前提是我们以那种方式使用它。

强大的 AI 可以帮助加固银行、医院、政府、浏览器、手机、服务器以及开源项目所依赖的软件。

我预计这种模式会重复。同样的能力让 AI 有风险,也让它有用。同样的自主性可能被滥用,也可以用来防御、发现、修复和建设。

与其说是一把双刃剑,不如说是一件双刃的认知核武器。

下一个前沿是进行 AI 研究

而网络并非故事的终点。

它只是文明基础设施中第一个触及实质问题的领域。

下一个前沿是 AI 系统进行 AI 研究本身。然后,可能是大规模的自主科学研究。

@jackclarkSF,Anthropic 联合创始人兼 Import AI 作者,最近表示他现在认为到 2028 年底,出现无人在环的 AI 研发的可能性超过 60%。用通俗的话说:一个足够强大的 AI 系统,能够自主构建自己的继任者。

这听起来像科幻,直到你审视 AI 研究的本质以及模型已经擅长什么。

想一想。什么是 AI 研究?其中一部分是灵感。新想法。品味。奇怪的直觉。那种让人从独特视角看待问题的东西。

但很大一部分是其他东西。

很多 AI 研究是写代码、运行实验、清理数据、阅读论文、复现结果、调试训练运行、优化内核、比较模型输出、搜索失败的尝试,然后重新再来。

这正是智能体越来越擅长的任务。

@karpathy 的 autoresearch 项目证明,今天的 AI 模型已经能够自主进行研究以改进模型自身的超参数。如果不仅能改进超参数,还能自主改进算法、架构、数据配比——所有使模型变得比当前更强的要素——那会发生什么?

这就是最新的 METR 结果发挥作用的地方。目前模型可以完成可能需要一名人类软件工程师几天时间的编码任务。很快,模型可能能够完成需要人类研究员更长时间的研究任务。

AI 还不是最优秀人类研究员的替代品。不是那种按指令就能发明 Transformer 继任者的神奇预言机。

但它是一位合成同事,可以承担越来越多的辛苦工作。

一旦 AI 能够自动化 AI 研究的很大一部分,进步就不再仅仅受限于能够思考、编码、测试和迭代的人类研究员数量。进步开始受限于算力、数据、评估、安全性,以及我们引导这些系统的能力。

然后人类研究员可以做他们最擅长的事:坐下来寻找灵感。而自主 AI 研究员可以做机器最擅长的事:执行艰苦工作,永不觉无聊或疲倦。

因为如果 AI 帮助构建更好的 AI,而更好的 AI 又帮助构建更优秀的 AI,反馈循环就变成了递归。正在改进的事物也成为了改进过程的一部分。

这就是为什么“大事正在发生”变成了“它比你想象的更重大”。人类很难概念化指数级进步。这不是我们进化出来的能力。

AI 进步可能会实质性地加速,超越我们因固有认知局限而能够想象的程度。

如果 AI 能够自动化自身的研究,那么它最终可能自动化整个科学研究。它可能变得能够自主创造解释性的科学知识。而且它可以 7x24 小时不间断地做到这一点。在 AI 能够在原子空间进行实验之前,这更困难,但也是合理的。

量子物理学家和科学哲学家 David Deutsch 将真正的财富定义为“你拥有知识能在世界上实现的一系列物理变换。”

强大的 AI 可能达到这样一个点:它可以自主地、不停地创造那种财富,只要我们的数据中心还在运行。

积极面不仅仅是生产力

这就是为什么积极面远比“AI 让工人更高效”要大得多。

这个框架是正确的,但它太小了。它让 AI 听起来像更好的电子邮件、更快的电子表格、更便宜的客户支持和更快的软件工程师。有用。有价值。经济上重要。

但不是世界历史性的。

真正的积极面不是 AI 让我们更快地做同样的事情。而是 AI 可能让我们做到今天完全无法做到的事情。

积极面在于 AI 为人类解锁了新的视野。

它可能让我们搜索那些对人类团队来说过于庞大的空间。阅读任何单个研究员都无法读完的浩瀚文献。运行模拟、提出实验、调试失败、生成假设、编写代码、比较结果,并在实验室里所有人都回家后继续工作。

这比生产力更大。

这是发现的加速。

一个具体的例子是药物发现。Isomorphic Labs 最近筹集了 21 亿美元来构建设计新药物的 AI 系统。这并不意味着 AI 已经治愈了疾病。也不意味着生物学已被解决。生物学是混乱的、昂贵的、物理的,并且残酷地令人谦卑。

但这确实意味着一些世界上最聪明的资本现在正在押注 AI 能够改变发现药物的经济性。

Isomorphic 宣称的使命是**“解决所有疾病。”**

那将是一件相当重大的事。

因为对 AI 的乐观案例不是“你的老板得到了一个更便宜的实习生。”乐观案例是人类在对抗癌症、阿尔茨海默病、罕见疾病、抗生素耐药性、衰老、气候、材料科学、能源以及所有其他困难问题上获得更多机会,而这些问题的进展都受限于我们创造和测试知识的速度。

我们许多人仍然将 AI 视为一种劳动技术。一种生产力工具。

我们问:它取代谁的工作?它压缩谁的薪水?哪家公司变得更高效?

这些都是重要的问题。我们应该认真对待。会有颠覆。会有输家。会有一些人被卷入这场变革,而他们并未要求成为文明技术实验的一部分。那可能是我们大多数人。我们不应轻描淡写地忽略这一点。

但劳动并不是这里最深的范畴。

知识才是。

如果 AI 成为一个创造新知识的系统,那么相关的比较不是外包或自动化。而是印刷术。科学方法。计算机。互联网。也许比所有这些都更大,因为这一次工具不仅仅是存储或传输人类思想。它开始参与到产生思想的过程中。

它将是一股能够创造新知识的力量。有史以来,人类一直是这股力量的唯一已知例子。

这就是让这一刻变得:

比你想象的更重大。

同一套能够发现软件漏洞的系统,可能帮助保护医院和银行。同一套能够自动化 AI 研究部分的系统,可能帮助自动化生物学、化学、材料科学、工程学和医学的部分。同一套能够取代某些形式工作的系统,也可能让数百万人获得之前无论如何都无法负担的导师、教练、合作者、翻译、程序员、分析师和老师。

想象一个世界:小镇上的孩子可以拥有一个无限耐心的、能根据个人情况调整的导师,学习数学、编程、物理、写作、生物学、设计和创业。

想象一名护士转行学习软件。一名工厂工人学习机器人技术。一位创始人构建一个五年前需要二十人工程团队才能完成的产品。一位罕见病患者获得 AI 辅助的最新研究解读,而他们当地的医生永远没有时间阅读。

这些都不是必然的。

这部分很重要。

强大的 AI 不会自动公平地分配自己。它不会自动治愈疾病。它不会自动让人们更明智、让制度更好、让社会更人道。它可以集中权力。它可以加速冲突。它可以扩大不平等。它可以用合成说服力和自动化攻击淹没世界。

但是,面对一项可能自动化科学大部分领域的技术,只看到危险也是不现实的。

危险是真实的。积极面也是真实的。

而且积极面不是微不足道的。

如果我们能将这些系统引导到正确的方向,它们可能成为文明解决问题速度超过问题累积速度的一种方式。它们可能帮助我们加固数字世界,发现新药物,发明新材料,教授新技能,构建新制度,并创造不仅限于金融的财富,还有物理的、科学的、教育的和人类的财富。

它们可能帮助我们推迟死亡。它们可能帮助我们扩展生命。

这就是我认为人们仍然低估的“大事正在发生”的版本。

比更智能的模型更伟大。

比更好的编程智能体更伟大。

比带聊天框的生产力软件更伟大。

一个创造知识的新引擎。

这就是为什么我们必须把它做对。

危险是真实的。但它们不是全部故事。

这就是公众讨论通常崩盘的地方。正因如此,我们需要走到一起。

一方看到积极面,将风险视作恼人的脚注。另一方看到风险,将积极面视作营销幻觉。

两方都错了。

越接近真相,你就越能感知到悖论。

F. Scott Fitzgerald 说过:

“检验一流智力的标准,是头脑中能同时持有两种相反观点,仍能保持运作的能力。”

在这个话题上,我们需要的正是这种智力。

我们需要看到两个方向。同时。

我们需要在面对灾难性的下行风险的同时,不忽略可能超越历史上任何事物的上行潜力。我们需要在认真对待安全、治理、对齐、公平分配的同时,不变得玩世不恭或宿命论。我们需要在构建这些系统的同时,不假装我们确切知道它们将如何发展。

我们需要放弃确定性,选择责任。

关于作者

相似文章

Claude Mythos、ChatGPT-5.5 与网络安全

Reddit r/ArtificialInteligence

Anthropic 的 Claude Mythos 和 OpenAI 的 ChatGPT-5.5 前沿模型因其能够自主识别并利用漏洞而引发网络安全担忧。马克斯·普朗克研究所的研究人员讨论了实际风险以及欧洲在进攻性人工智能系统方面整合知识的必要性。