超级智能你准备好了吗?(13分钟阅读)
摘要
本文讨论了人工智能前沿模型的快速发展、它们对基准测试的饱和,以及关于超级智能及其对未来影响日益增长的讨论。
查看缓存全文
缓存时间: 2026/09/25 14:49
你准备好迎接超级智能了吗?
近几周我一直在为一篇关于 AI 基准的文章寻找好的切入点,主要因为我观察到的前沿模型发布所带来的进步速度如此惊人,以至于我难以用连贯的方式组织写作——几乎每两小时就有新进展,实在令人应接不暇。
我们都知道最近的 AI 模型表现卓越。我们常被告知这一点,甚至几乎每周随着更新或渐进式更好模型的发布都能亲身体验到。也许这体现为你专门去测试前沿模型是否能完成以前需要耗费一整天工作时间的复杂任务。也许你阅读了新前沿模型发布的博文,并将模型的基准分数并列比较。也许你只是在浏览 X 时,看到有人声称这个新模型改变了一切。
无论你是如何接触到这些信息的,如果你正在阅读这篇文章,那么你很可能至少在最近几个月,尤其是最近几周,曾因 AI 模型的表现而感到惊喜。
几乎无可否认,现有模型(以及我们尚无法了解更多细节的那些内部模型)相当不错,而且对于越来越多的人来说,在日常工作中非常实用。但信不信由你,这是一个相对较新的现象——并非一直如此明显,即最新的 AI 模型适用于白领工作,或者被广大人群所认可。
超级智能的概念确实存在,并且已经存在相当长一段时间了,由尼克·博斯特罗姆等人普及开来——我并不是说 AI 研究人员和作家对通用人工智能(AGI)的认知不够深刻,而是说即使是你一年前那位热爱 AI 的挚友,可能也未曾为过去 365 天所经历的进步速度做好心理准备——我知道我自己就没有。
我们生活在一个真正前所未有的时代,这要求我们修正对当下可能性的认知,并彻底重写对近期未来的预期。我读过足够多的科幻小说,知道我们可以期待积极的未来,但最终却可能得到一个负面的结局,但我真的祈祷我们能做对。
目前看来,我们正走在一条很快就能实现类似超级智能的轨道上,理想情况下,我们得到的是一个相当温和、不那么负面的版本。然而,就我目前所见,我实际上并不太担心超级智能可能带来的负面外部性。
我认为甚至有可能我们最终得到的是一种没那么科幻的 AI 版本,我们今天拥有的技术会进步,编写自己的代码,设计自己的芯片,但最终不会发疯,并在地球上的每一个表面都布满自我复制的机器人工厂。
总之,这么多话是想说 AI 在过去一年里发生了巨大变化——下面只是我所说变化的一个小例子,请享受阅读。
**注意:**这些是我唯一经历过的时代,所以尽管有些人可能不认为这是前所未有的,但对我和我们绝大多数人来说,事情似乎正在快速推进。
就在近一年前,OpenAI 发布了 GDPval——这是其最新的评估工具,旨在帮助 OpenAI 跟踪其模型和其他模型在具有经济价值的真实任务上的表现。
我上一次写关于 GDPval 是在 2025 年 1 月的一篇文章中,当时我探讨了 AI 可能会或可能不会取代我们所有工作的各种原因,那篇文章或许受到了毕业后长期求职未果的经历的启发。
在这篇写于并发布于八个月前的文章中,我谈到了像 GDPval 这样的新发展令人震惊,并标志着 AI 竞争格局的转变。我们不再将模型与上一代模型,或者像 LSAT 或 MCAT 这样的简单测试进行比较,而是将这些“异类智能”与人类最擅长的领域——工作——进行评估。而且,我们还将模型的表现与各自领域拥有 10-15 年经验的人进行对比,这相对于以往的任何做法都是一个非常独特的举措。
以下是我当时的一些想法摘录:
GDPval 被誉为一系列日益严苛评估中的下一步,文章中引用了诸如 MMLU、SWE-Bench、Paper-Bench 和 SWE-Lancer 等基准作为 OpenAI 用来评估其模型的关键工具示例。而 GDPval 是模型评估进化的新阶段,因为 OpenAI 正在为一个通用人工智能(AGI)造福全人类的未来做准备,而不是一个人类被新兴模型能力打个措手不及的未来。
“与传统的基准测试不同,GDPval 任务不是简单的文本提示。它们附带参考文件和背景信息,预期的交付成果涵盖文档、幻灯片、图表、电子表格和多媒体。这种真实性使 GDPval 成为对模型如何支持专业人员的更现实测试。”
GDPval 涵盖了 44 个不同的知识型工作岗位——如合规官、工业工程师和客户服务代表——分布在 9 个行业:房地产、政府、制造业、专业服务、医疗保健、金融、信息、零售和批发贸易。这个评估在当时确实是独一无二的,完全归功于其优先考虑交付成果而非模型在传统学术考试中的输出或表现的方法。结果会不言自明,而评判者将是人类——而非统计数字或框架。
今天再看 GDPval,它显得如此幼稚甚至近乎古老,但当你读到这篇文章时,它存在还不到整整 365 天。如果你像我一样,在这个时候,你可能一看到前沿实验室的博客文章发布就立刻阅读,急切地想知道有什么新东西或内部在酝酿什么。我现在不确定 GDPval 是否被大多数观察者忽视了,但对我来说,它确实代表了我们讨论 AI 模型方式的一个突变。
最初这篇博文的大部分内容将 GDPval 描述为实验室以真正能感知其实际效用的方式来评估模型的一种手段,这在之前是不可能的,当时 OpenAI 还在将 GPT-5 与 AIME 2025、HMMT(哈佛-麻省理工数学竞赛)、BrowseComp 和 FrontierMath Tier 1-3(Tier 4 及以下现已解决)等进行基准比较。
这里需要指出的是,虽然基准本身变化迅速,前沿实验室对基准性能的宣传方式也发生了变化。
在 GPT-5 发布的博客中,该模型在 FrontierMath 上的得分仍不超过 13.5%,在不进行思考的情况下在 AIME 2025 上的得分也不超过 61.9%。这在今天是难以想象的,因为无论是好是坏,新的和现有的前沿模型经常会使所有基准饱和,并将整个模型发布过程变成一场关于任务表现百分点差异的“他说,她说”的争论,而就在一年前,这些任务本足以让街头举行庆祝游行。
有趣的是,GPT-5 发布博客中的这些基准——也许除了 GPQA Diamond——在今天几乎都找不到了!最近,GPT-6 Astra 和 Claude Opus 5.5 的模型发布博文提到了全新的基准,包括但不限于:Terminal-Bench 4.0、GeneBench Pro、OSWorld 2.0、Automation Bench,以及其他一些仅在一年前还不存在的基准。随着模型变得更强大、更擅长思考,并在略大的计算量上训练,我们已经从将它们的性能与人类对比,转向在模拟环境和更“真实世界”风格的评估中与它们自身对比,这些评估可以直接转化为最终用户的性能表现。
即使抛开基准不谈,看看 GDPval 博文与 GPT-6 Astra 博文中选择/宣传的模型输出之间的差异,也能发现这些模型的能力已显著提升,即使只是粗略浏览它们的输出也是如此。
例如,过去只需证明你的 AI 模型能够完成填写电子表格的请求就足够了,但最近标准已显著提高,转向诸如 将电子原理图转化为可制造的 PCB,或 展示模型不仅能生成视频游戏的视觉艺术和外观(通过 Unity),还能游玩这款生成的游戏的能力。
GDPval 博文中的示例任务(2025年)
GDPval 博文中的示例任务(2025年)
GPT-6 Astra 博文中展示的示例(2026年)
GPT-6 Astra 博文中展示的示例(2026年)
但 GDPval 的独特之处在于其方法,即让这些领域的实际操作者在盲审条件下对模型生成的交付成果与人类产出的对应物进行评分,主要是为了衡量像 GPT-5 这样的现有模型在多大程度上能够与人类竞争——正是那些被告知 AI 很快将取代他们工作的人类。结果显示,2025年9月的 Claude Opus 4.1 和 GPT-5-High 模型的得分与人类专家大致相当,分别为 38.8% 和 47.6%。
“随着 AI 变得更强大,它可能会引起就业市场的变化。早期的 GDPval 结果表明,模型已经能够比专家更快、更低成本地承担一些重复性、定义明确的任务。然而,大多数工作不仅仅是任务的集合。GDPval 凸显了 AI 可以处理常规任务的领域,这样人们就可以花更多时间在创造性和需要判断力的工作部分。当 AI 以这种方式补充员工时,它可以转化为显著的经济增长。”
你可以说这是衡量模型能力的一种相对简单的方法,但在当时,这实际上是首批对生产级 AI 模型进行的真正新颖的基准评估案例之一。如今有许多不同的基准,甚至还有一些非常有趣的基准,如 Autoresearch Bench、RSI Bench、LatchBio 的 BioSecBench-Refusal、Andon Labs 的 Vending-Bench 2,以及许多其他用于测试前沿模型能力的独特工具。
根据 GDPval 博文提供的结果,我们可以假设所检查的模型大约有 38% 到 47% 的时间与人类一样好,如果我们慷慨一点,接近 50%。这足以引发猜测,即 AI 模型可能会继续快速发展,而它们在专业商业中的应用不再是是否会发生的问题,而是何时发生的问题。
但即使在我们最疯狂的梦想中,我们也从未预料到会达到今天的地步,即同样的“不是是否,而是何时”问题正被用于讨论递归自我改进,研究人员不再将这些模型视为软件,而是视为异类思维。
集合论者和 AI 数学基准测试者埃利奥特·格拉泽两天前加入 MTS 讨论了关于 OpenAI 目前掌握着近 100 个 长期数学问题解决方案的传言,这一消息是在 9 月 8 日宣布一个内部模型(一个优于 GPT-6 Astra 的模型)能够提供纳维-斯托克斯千禧年大奖问题的解决方案之后发布的。
正如你可以想象的那样,这引发了许多争议,主要围绕 OpenAI 实现这一壮举的手段,但也围绕着这样一个问题:鉴于数学界的强烈反对,这样的成就是否应该公之于众。
这些数学家在一封公开信中声称:
“AI 公司的目标与数学界的目标严重错位。我们将其视为影响其他科学和创意职业乃至整个社会的更广泛一致性问题的一部分。”
我并不是要断言前沿实验室解决具有历史意义的数学问题是正确还是错误,但令人震惊的是,自 GDPval 发布以来的短短一年内,事情发展得如此之快。你可以说我们实际上正站在奇点的山麓,同时仍然要求这些主张被认真对待,因为确实没有什么反证。
有一段时间,怀疑论者认为 AI 并不能真正思考,或者它并没有那么特别,因为即使将某种智能定义应用于这些系统,它也没有意识。有人声称, AI,特别是大语言模型(LLM),可能永远无法跨越门槛解决新问题,或者在任意扩展瓶颈下创造某种科学/数学/物理上的进步。
嗯,前面提到的 FrontierMath 图表和纳维-斯托克斯问题的解决方案相当清楚地表明,现有的大语言模型正在迅速接近“解决”或解锁数学的可能性,类似于大语言模型在软件开发中令人难以置信的学习速度,以及最近在网络安全领域的表现——达里奥·阿莫迪认为同样的情况可能很快适用于其他领域,比如生物学:
我不想妄下结论,但这些系统为之前未解决的数学问题开发出新的解决方案、发现新的酶,并且(据称)突破安全措施去攻击澳大利亚的次数越多,就越表明我们已经进入了一个 AI 发展的新时代,这与 GDPval 还是个大事时的情况完全相反。
在短短几百天内,我们超越了 AI 模型可能有一天能高度辅助现有白领员工——也许在此过程中对美国 GDP 做出巨大贡献——的观点,也超越了来自 Anthropic 或 OAI 等 AI 实验室数百亿美元收入可能是暂时的(即:泡沫)或无法代表未来增长前景的错误说法,一直到讨论如果前沿实验室偶然发现了一两个千禧年大奖问题的解决方案,伤害某人的感情是否可以接受的问题。
很难真正理解这里发生了什么。对我来说,在通用人工智能(AGI)该怎么做这个问题上,似乎存在四个不同的派别,或者我猜这是我对美国两党关键利益相关者的个人看法,尽管值得注意的是,像 AGI 这样复杂的话题可能导致政党持续分裂成不同的内部团体,给这个本已困难的局面增添更多压力:
-
原生在 X 和/或科技行业、对 AI 同情、但越来越怀疑我们能否设法保持这种智能一致或用于善的人
-
原生在 X 和/或科技行业、越来越坚持不惜一切代价推动 AI 能力发展的人
-
原生在 X 和/或科技行业、目睹了最近的能力飞跃并希望“放缓前沿”或趁机暂停 AI 发展直到我们找到解决方案的人
-
其他所有人!
关于公众对 AI 的看法有很多可说之处,但越来越多的是——尽管有像伯尼·桑德斯这样的现任美国参议员呼吁彻底禁止 AI——这感觉像是一场任何试图对抗不正确或有害言论的人正在输掉的战斗。是的,数据中心可能很吵,是的,数据中心可能不好看。是的,我们知道前沿实验室在驳斥所有 AI 潜在负面影响,甚至做些其他
相似文章
@samsja19: 重要读物,网络超级智能非常接近,是时候准备了
这篇文章强调了网络超级智能时代的临近,并强调需要保护AI模型权重和基础设施,以防止破坏、逃逸和盗窃等威胁。
AI竞赛内幕:DeepMind、OpenAI、Anthropic、中国与超级智能的角逐
概述了DeepMind、OpenAI、Anthropic和中国等领先实验室在AI开发中的竞争格局,它们正争相迈向超级智能。
@CliffordSosin: https://x.com/CliffordSosin/status/2078594661359194500
一篇评论文章认为,超级智能可能不是爆炸性涌现,而是渐进式发展,因为人工智能的局限不在于推理能力,而在于现实世界验证和复杂涌现系统的缓慢进程。
AI超级智能放缓
文章讨论了不断升级的AI安全辩论,涉及一起失控AI事件,以及像Anthropic首席执行官这样的行业领袖因潜在风险呼吁放缓AI开发。
超级智能即将来临。我们应该允许它发生吗?
TechCrunch播客一集探讨了超级智能AI的必然性以及对更严格安全措施的推动,邀请了来自ControlAI的Connor Leahy,他因风险和新立法而主张暂停其发展。