@CalcCon: 要真正实现AGI,我们必须超越工程技巧,建立深度学习背后的科学原理……

X AI KOLs Timeline 论文

摘要

一位研究者声称利用重整化群理论建立了深度学习背后的科学原理,超越了工程技巧,可能为AGI铺平道路。这项工作基于2021年发表在JMLR和《自然·通讯》上的论文。

要真正实现AGI,我们必须超越工程技巧,建立深度学习背后的科学原理。 我们发现最令人惊叹的事情之一是,最好的深度神经网络的最佳层似乎都收敛于一个通用签名 这项工作可以追溯到我们2021年在JMLR和《自然·通讯》上发表的论文,实际工作是在2018年完成的。很难相信已经过去这么久了 从一开始我就很清楚,这些签名类似于重整化群理论中的通用临界指数。 经过数年的工作、大量出版物和演讲,以及大量的心血,我认为我终于攻克了这个问题,能够提供一个完整的Wilson RG视角来理解学习过程中发生的事情 (我唯一的遗憾是我的博士导师在今年早些时候去世了,我没能与他分享这一成果,他是RG理论领域的巨匠之一。)
查看原文
查看缓存全文

缓存时间: 2026/07/20 13:27

要真正实现通用人工智能(AGI),我们必须超越工程上的拼凑,建立深度学习为何有效的科学原理。

我们最重要的发现之一,是最优深度神经网络的最优层在收敛时似乎都带有一种普适的印记。

这项工作可追溯到我们在2021年发表于《机器学习研究杂志》(JMLR)和《自然·通讯》(Nature Communications)的论文,而实际完成时间更早,在2018年。真不敢相信已经过去这么久了。

从第一天起我就清楚,这些印记类似于重正化群(RG)理论中的普适临界指数。

经过数年的工作、大量论文发表、演讲和诸多心血付出,我认为我终于解开了这个谜,并能提供一个完整的Wilson型重正化群视角来解释学习过程中发生的事情。

(唯一遗憾的是,我的博士导师在今年早些时候去世了,我未能与他分享这一成果——他可是RG理论领域的泰斗之一。)

想了解更多,请查看开源项目 weightwatcher:

https://weightwatcher.ai

以及关于RG理论的研究页面: https://weightwatcher.ai/rg_theory_webpage/rg_theory.html…

部分论文与报告:

KDD Workshop 2019 https://dl.acm.org/doi/abs/10.1145/3292500.3332294…

JMLR 2021 https://jmlr.org/papers/v22/20-410.html…

Nature Communications 2021 https://nature.com/articles/s41467-021-24025-8…

NeurIPS 2023 Spotlight 论文 https://neurips.cc/virtual/2023/poster/70435…

我的2023年NeurIPS受邀报告 https://nips.cc/virtual/2023/workshop/66530#wse-detail-83033…

SETOL 2023 存档论文(140页统计力学!): https://arxiv.org/abs/2507.17912

ICML 2025 Workshop 论文(更新版) https://arxiv.org/pdf/2605.12394

同时欢迎加入 WeightWatchers 社区频道进行讨论。

另外,补充一点:我的已故博士导师不仅是你能共事的最优秀、最友善的人之一,而且是你梦寐以求的最佳导师。

历史上,培养出两位或更多诺贝尔奖得主学生的教授屈指可数(不超过二十几位)。我能有幸与他培养出的两位诺奖得主在同一团队中学习,倍感幸运。

是的,我确实这样认为。在最新的草稿论文中,你会看到我为此提供了论据——既用了统计学习理论的论证,也用了重正化群理论的论证。

这正是我试图解决的问题。谢谢。

大多数人试图通过分析模型的输出来解决这个问题。

我的方法非常不同。

我试图理解模型在给定数据和所提供的反馈循环下,是否被正确地训练了。

值得注意的是,如果你查看可用的开源基础模型,其中许多实际上表现欠佳。

最突出的是,OpenAI的开源模型看起来糟糕,似乎几乎每一层都对训练数据过拟合了。

其他模型则只是训练得不够充分,浪费了巨大的容量。

当然,如果你用疯狂的数据训练模型,它自然会给出疯狂的结果。我对此无能为力——那是一个完全不同的问题,我很高兴有其他人在研究它。

相似文章

衡量通向AGI的进展:一个认知框架

Google DeepMind Blog

Google DeepMind发布了一篇论文,提出了一个衡量通向通用人工智能(AGI)进展的认知框架,识别了十项关键认知能力,并发起了一场Kaggle黑客马拉松以构建相关评估方法。

下一个范式(7分钟阅读)

TLDR AI

文章认为,在多样化的强化学习环境中对数百万可验证任务进行AI训练可能实现通用人工智能,并且扩展规模可能克服当前如样本效率低下等限制。文章还探讨了由于缺乏可重复训练的环境,计算机使用方面的进展为何较为缓慢。

走向AGI的负责任之路

Google DeepMind Blog

DeepMind发布了一套关于AGI安全与安保的综合方案,阐述了系统性框架来应对滥用、失对齐、意外事故和结构性风险,为即将到来的通用人工智能做准备。