慕尼黑1991:当前人工智能热潮的根源

Hacker News Top 新闻

摘要

David Ha和Jürgen Schmidhuber回顾了诸如Transformer、无监督预训练、知识蒸馏和残差网络等基础深度学习技术是如何在1991年的慕尼黑开创的,为当前的人工智能热潮奠定了基础。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/22 10:32

# 慕尼黑1991年:当前人工智能繁荣的根源 来源:https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html David Ha (https://twitter.com/hardmaru),Sakana AI Jürgen Schmidhuber (https://people.idsia.ch/~juergen/),KAUST & IDSIA 2026年6月18日 @hardmaru (https://twitter.com/hardmaru) @SchmidhuberAI (https://twitter.com/SchmidhuberAI) AI博客 (https://people.idsia.ch/~juergen/blog.html) ## --- 慕尼黑1991年:当前人工智能繁荣的根源 序言 作者:David Ha (https://twitter.com/hardmaru) --- 当我们审视当今人工智能的庞大规模时,很容易忘记这个万亿美元产业的基石早在30多年前就已奠基于慕尼黑。 如今,全球顶级科技公司正投入数千亿美元来扩展大型语言模型(LLMs,如ChatGPT)。然而,除了少数历史爱好者或机器学习界的资深人士,大多数人可能没有意识到,这些现代系统的几乎所有核心构建模块,都是在1991年 (https://people.idsia.ch/~juergen/deep-learning-miraculous-year-1990-1991.html)短短几个月内集中发表的。难以置信的是,它们全部出自慕尼黑工业大学 (https://people.idsia.ch/~juergen/cogbotlab.html) 的同一个实验室,由 Jürgen Schmidhuber (https://people.idsia.ch/~juergen/cv.html) 领导。 在那一年结束之前,他的团队已经基本勾勒出现代深度学习时代的轮廓。他们发表了第一个 Transformer (https://people.idsia.ch/~juergen/who-invented-transformer-neural-networks.html) 变体(即ChatGPT中的“T”),引入了无监督预训练 (https://people.idsia.ch/~juergen/very-deep-learning-1991.html) 的概念(ChatGPT中的“P”),并开创了神经网络蒸馏 (https://people.idsia.ch/~juergen/who-invented-knowledge-distillation-with-neural-networks.html) 技术。他们还引入了深度残差学习 (https://people.idsia.ch/~juergen/who-invented-residual-neural-networks.html),这是 LSTM 和 ResNet 的核心组成部分(它们分别是20世纪和21世纪被引用最多的AI论文)。这四项技术驱动着当今最先进的大语言模型。此外,他们还为生成对抗网络 (https://people.idsia.ch/~juergen/who-invented-generative-adversarial-networks.html) 奠定了早期基础,而这正是“生成式AI”的基石。 Jürgen的贡献多年来深刻影响了我自己的思考,从我还在 Google Brain (https://otoro.net/ml/) 的时候,到我们目前在 Sakana AI (https://sakana.ai/rsi-lab/) 推进的递归自我改进 (https://people.idsia.ch/~juergen/metalearning.html)(RSI)研究。我尤其自豪的是,在2018年帮助推广了世界模型 (https://people.idsia.ch/~juergen/world-model-boom.html),这直接建立在他在1990年代实验室引入的概念 (https://people.idsia.ch/~juergen/world-models-planning-curiosity-fki-1990.html) 之上。 看到这些想法如何经受住时间的考验,并被全球AI社区大规模采纳,真是令人惊叹!对于那些对深度学习的真实历史 (https://people.idsia.ch/~juergen/deep-learning-history.html) 感兴趣的人,Jürgen在下面整理了一份详细的时间线,精确描述了这些种子是如何在1991年的慕尼黑种下的。 David Ha (https://twitter.com/hardmaru),2026年6月 ### --- Jürgen Schmidhuber 的1991年时间线,附注释参考文献 --- 我为我的团队在1991年 (https://people.idsia.ch/~juergen/deep-learning-miraculous-year-1990-1991.html)于我的家乡所做的工作感到自豪——那时计算成本比现在贵数百万倍[\[RAW\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#RAW),也为当时及之后与我共事的所有优秀人士感到自豪。请看慕尼黑工业大学以下关键AI出版物,日期为1991年3月26日至1991年8月31日。 --- **★ 1991年3月26日:** (https://people.idsia.ch/~juergen/deep-learning-history.html#transformer)第一种 Transformer (https://people.idsia.ch/~juergen/who-invented-transformer-neural-networks.html)(即ChatGPT中的T)——现在称为非归一化线性 Transformer (https://people.idsia.ch/~juergen/1991-unnormalized-linear-transformer.html)[\[ULTRA\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#ULTRA)[\[FWP0\-6\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#FWP)[\[WHO10\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO10)[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH):归一化二次 Transformer (https://people.idsia.ch/~juergen/who-invented-transformer-neural-networks.html)[\[TR1\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#TR1) 的前身。ULTRA至今依然重要,尤其是因为其效率:其计算成本随输入大小 *线性* 缩放,而非 *二次* 缩放。 --- **★ 1991年4月30日:** (https://people.idsia.ch/~juergen/deep-learning-history.html#unsupdl)深度神经网络 (NNs) 的预训练 (https://people.idsia.ch/~juergen/very-deep-learning-1991.html)——即ChatGPT中的P[\[UN0\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN0)[\[UN1\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN1)[\[UN2\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN2)[\[UN\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN)[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)。这使得非常深的深度学习 (https://people.idsia.ch/~juergen/who-invented-deep-learning.html)[\[WHO5\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO5) 成为可能。 --- **★ 1991年4月30日:** 神经网络蒸馏 (https://people.idsia.ch/~juergen/who-invented-knowledge-distillation-with-neural-networks.html)——对于著名的2025年 DeepSeek “Sputnik” (https://x.com/SchmidhuberAI/status/1885357355938046382) 及其他大型语言模型 (LLMs) 至关重要[\[UN0\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN0)[\[UN1\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN1)[\[UN2\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#UN2)[\[WHO9\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO9)[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)。 --- **★ 1991年6月15日:** (https://people.idsia.ch/~juergen/deep-learning-history.html#vanish)深度残差学习 (https://people.idsia.ch/~juergen/who-invented-residual-neural-networks.html),采用残差连接来实现非常深的神经网络[\[WHO11\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO11)(参见 Sepp Hochreiter 的文凭论文 (https://people.idsia.ch/~juergen/deep-learning-history.html#vanish)[\[VAN1\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#VAN1)):长短期记忆 (https://people.idsia.ch/~juergen/deep-learning-history.html#lstm)[\[LSTM1\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#LSTM1) 的核心成分,该网络是20世纪被引用最多的AI,也是2010年代第一批大语言模型 (ELMO, ULMFiT) 的基础。 *21* 世纪被引用最多的科学文章[\[MOST25\-26\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#MOST25) *同样* 是关于深度残差学习 (https://people.idsia.ch/~juergen/who-invented-residual-neural-networks.html),重点关注我们受LSTM启发的深度残差 Highway Net (https://people.idsia.ch/~juergen/highway-networks.html)[\[HW1\-25b\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#HW) 的一个变体,该网络比之前的全连接前馈神经网络深10倍 (https://people.idsia.ch/~juergen/who-invented-residual-neural-networks.html)[\[WHO11\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO11)[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)。深度残差学习 (https://people.idsia.ch/~juergen/who-invented-residual-neural-networks.html) 如今几乎被用于所有大语言模型中。 --- **★ 1991年8月31日:** (https://people.idsia.ch/~juergen/deep-learning-history.html#gan)关于生成与对抗网络 (https://people.idsia.ch/~juergen/who-invented-generative-adversarial-networks.html)[\[GAN90\-25\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#GAN90) 的第一篇同行评审出版物[\[GAN91\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#GAN91),用于通过人工好奇心与创造力 (https://people.idsia.ch/~juergen/artificial-curiosity-since-1990.html) 训练神经世界模型 (https://people.idsia.ch/~juergen/world-model-boom.html)[\[WM26,WM26b\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WM26)——现在被有争议地用于深度伪造及其他生成式AI应用[\[WHO8\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO8)[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)。 --- 截至2026年1月,有史以来被引用次数最多的两篇论文(三年内被引用最多——手册除外)直接基于1991年 (https://people.idsia.ch/~juergen/deep-learning-miraculous-year-1990-1991.html)[\[MOST26\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#MOST26)[\[MOST\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#MOST)[\[MIR\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#MIR) 的工作。然而,在1991年,已经非常清楚的是,仅靠类似LLM的神经网络不足以实现 *通用人工智能*(AGI)。没有对真实世界的掌握,就没有AGI[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)! 这就是为什么我们开始研究实现AGI所需的其他技术,例如,使用自适应世界模型 (https://people.idsia.ch/~juergen/world-models-planning-curiosity-fki-1990.html)[\[PLAN1\-6\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#PLAN)[\[WM26,WM26b\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WM26) 进行规划,这些模型由人工科学家 (https://people.idsia.ch/~juergen/artificial-curiosity-since-1990.html)[\[AC\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#AC)(自1990年起在慕尼黑工业大学)创建,以及元学习与递归自我改进 (https://people.idsia.ch/~juergen/metalearning.html)(自1987年起)[\[META1\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#META1)[\[META\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#META) 等[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)[\[AIB\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#AIB)。 --- **大约在同一时期**,慕尼黑也是道路上首批自动驾驶汽车 (https://people.idsia.ch/~juergen/robotcars.html)[\[AUT\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#AUT)(由Ernst Dickmanns的团队完成)的发源地,速度可达175公里/小时。这座城市曾是真正的人工智能中心。然而,在过去的三十年里,大多数商业人工智能已转移到环太平洋地区,远离慕尼黑。这是怎么发生的?能对此做些什么?请参见[\[95\-25\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#95-25) 以了解答案! 请参见 [\[WHO3\-11\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#WHO3) 了解1991年 (https://people.idsia.ch/~juergen/deep-learning-miraculous-year-1990-1991.html)[\[MIR\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#MIR) 所发表工作更广阔的历史背景 (https://people.idsia.ch/~juergen/deep-learning-history.html)[\[DLH\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#DLH)。我仍然希望有生之年能看到我们伟大的机器学习领域实现我1970年代青少年时期的愿景:制造出比我聪明得多的东西,这样我就能退休了。 Jürgen Schmidhuber (https://people.idsia.ch/~juergen/cv.html),2026年6月 ## --- 致谢 --- 知识共享许可协议 (http://creativecommons.org/licenses/by-nc-sa/4.0/)感谢几位专家审稿人的有用评论。(如果您发现任何剩余错误,请告知我们。)本文内容可用于教育和非商业目的,包括为维基百科及类似网站撰写文章。本作品采用知识共享署名-非商业性使用-相同方式共享 4.0 国际许可协议 (http://creativecommons.org/licenses/by-nc-sa/4.0/) 进行许可。 ## --- 注释参考文献 --- \[95\-25\] J. Schmidhuber (AI Blog (https://people.idsia.ch/~juergen/blog.html), 2025)。1995-2025:德国与日本 vs 美国与中国的衰落。全能机器人能否推动复苏? (https://people.idsia.ch/~juergen/GerJapUsaChiRobots.html)1995年,按名义国内生产总值 (GDP) 计算,德国和日本的总和几乎与美国和中国的总和在经济上持平(1:1),根据国际货币基金组织的数据。仅仅30年后,这个比例现在降到了1:5!自我复制的AI驱动全能机器人可能是答案。基于2024年F.A.Z.客座文章 (https://www.faz.net/pro/digitalwirtschaft/kuenstliche-intelligenz/juergen-schmidhuber-mahnt-baut-den-ki-gesteuerten-allzweckroboter-110120697.html)。 \[AC\] J. Schmidhuber (AI Blog (https://people.idsia.ch/~juergen/blog.html), 2021年,更新于2025年)。人工好奇心与创造力的三十年 (https://people.idsia.ch/~juergen/artificial-curiosity-since-1990.html)。*Schmidhuber的人工科学家不仅能回答给定的问题,还能发明新问题。他们通过以下方式实现好奇心:(1990年)生成对抗网络的原理,(1991年)最大化学习进度的神经网络,(1995年)最大化信息增益的神经网络(自2011年起最优),(1997年)令人惊讶的计算实验的对抗性设计,(2006年)像科学家/艺术家/喜剧演员一样最大化压缩进度,(2011年)PowerPlay...。自2012年起:应用于真实机器人。* 自1990-91年以来的人工好奇心与创造力 (https://people.idsia.ch/~juergen/artificial-curiosity-since-1990.html) \[AIB\] J. Schmidhuber 的 AI 博客 (https://people.idsia.ch/~juergen/blog.html)。包含关于人工智能与计算历史的课程,例如:谁发明了深度学习?谁发明了反向传播?谁发明了卷积神经网络?谁发明了人工神经网络?谁发明了生成对抗网络?谁发明了Transformer神经网络?谁发明了深度残差学习?谁发明了神经知识蒸馏?谁发明了计算机?谁发明了晶体管?谁发明了集成电路?... Jürgen Schmidhuber 的 AI 博客 (https://people.idsia.ch/~juergen/blog.html) \[ATT\] J. Schmidhuber (AI Blog (https://people.idsia.ch/~juergen/blog.html), 2020年,更新于2025年)。端到端可微顺序神经注意力的30周年。加上目标条件强化学习。 (https://people.idsia.ch/~juergen/neural-attention-1990-1993.html)*Schmidhuber既有用于中央凹的硬注意力(1990年),也有形式为具有线性化自注意力的Transformer的软注意力(1991-93年)[\[FWP\]](https://people.idsia.ch/~juergen/ai-boom-roots-munich-1991.html#FWP)。如今,这两种类型都非常流行。* 1990年:端到端可微顺序神经注意力。加上目标条件强化学习 (https://people.idsia.ch/~juergen/neural-attention-1990-1993.html) \[AUT\] J. Schmidhuber (AI Blog (https://people.idsia.ch/~juergen/blog.html), 2005年)。机器人汽车历史亮点 (https://people.idsia.ch/~juergen/robotcars.html)。*大约1986年,Ernst Dickmanns 及其在联邦国防军大学的团队*

相似文章

在课堂上教授人工智能基础

YouTube AI Channels

谷歌 DeepMind 的“课堂人工智能”项目向学生讲解数据需求、偏见和大语言模型等基础人工智能概念,旨在通过互动讨论培养未来的问题解决者。