@charliejhills:研究人员刚刚发布了一篇重新定义AGI实际含义的论文。它并非大多数人想的那样。论文开篇…
摘要
一篇新论文将AGI重新定义为在限制条件(计算、内存、能源)下的适应能力,并提出了一个“人工科学家基准”,专注于自主发现因果关系,而不是在固定任务上达到人类水平的表现。
查看缓存全文
缓存时间: 2026/05/25 10:50
研究人员刚刚发布了一篇论文,重新定义了通用人工智能(AGI)究竟是什么。
而它并非大多数人想的那样。
论文以一个看似简单的观点开篇:智能是在约束条件下的适应性——有限的计算资源、有限的内存、有限的能源。
按照这个定义,AGI 并非“一个能通过人类测试的系统”。
而是一个能够像人类科学家一样广泛且高效地适应的系统。
这意味着它需要:
1/ 从零开始规划实验 ↳ 不仅仅是遵循指令——设计探究过程
2/ 学习因果关系 ↳ 不仅仅是模式匹配——理解事物为何发生
3/ 平衡探索与行动 ↳ 知道何时收集更多数据,何时做出决定
4/ 自主运作 ↳ 任务中途无需人类插手
他们称之为“人工科学家基准”。
因为问题不在于“它能像人类一样思考吗?”
而在于“它能像人类一样发现吗?”
这就是标准。
不是在一组固定任务上达到人类水平的表现。
而是一个系统,能够高效、广泛、科学地适应任何任务。
我们目前还没有做到这一点。
但现在我们有了一个更清晰的定义,明确了我们到底在朝着什么方向努力。
来源:http://arxiv.org/abs/2503.23923
通用人工智能到底是什么鬼?
来源:https://arxiv.org/html/2503.23923 11institutetext:澳大利亚国立大学 11email:[email protected]###### 摘要
人工通用智能(AGI)是一个成熟的研究领域。然而,有些人质疑这个术语是否还有意义。AGI 被过多的炒作和猜测所淹没,变成了一种罗夏测试。Melanie Mitchell 认为,这场争论只有通过长期、科学的调查才能得到解决。为此,本文提供了一份简短、易懂且具有挑衅性的 AGI 概述。我比较了各种智能的定义,最终将智能定义为适应性,而 AGI 则是一种人工科学家。我借鉴了 Sutton 的“苦涩教训”,描述了构建自适应系统的两个基础工具:搜索和近似。我比较了它们的优缺点、混合体以及诸如 o3、AlphaGo、AERA、NARS 和 Hyperon 等架构。然后,我讨论了让系统表现得更智能的整体元方法。基于“苦涩教训”、奥卡姆剃刀和 Bennett 剃刀,我将它们分为规模最大化、简洁最大化、弱约束最大化。这些方法最大限度地提高了资源、形式的简洁性以及功能约束的弱化。我讨论了包括 AIXI、自由能原理和语言模型的“膨胀”在内的例子。我得出结论:尽管规模最大化的近似方法占主导地位,但 AGI 将是工具和元方法的融合。“膨胀”是由硬件改进推动的。现在,瓶颈是样本效率和能源效率。
关键词:
人工通用智能。
1 引言
想象一台拥有人类智慧的机器。从最简化的形式来看,这就是人工通用智能(AGI)[1 (https://arxiv.org/html/2503.23923v2#bib.bib1)]。AGI 也是一个完善且严谨的研究领域[2 (https://arxiv.org/html/2503.23923v2#bib.bib2)]。然而,公众对 AGI 的看法却被疯狂的猜测和炒作所困扰。有些人将其视为随时准备出击的天网 [3 (https://arxiv.org/html/2503.23923v2#bib.bib3),1 (https://arxiv.org/html/2503.23923v2#bib.bib1)]。另一些人,如 Melanie Mitchell,则质疑这个术语是否还有意义 [4 (https://arxiv.org/html/2503.23923v2#bib.bib4)]。猜测和炒作已将其降格为一种罗夏测试。正如 Mitchell 所指出的,这场争论不会由媒体解决,而将由严谨的科学研究来解决。为此,本文提供了一份简短易懂的概述。本文以故意挑衅的语言进行表述,旨在引发争论^1。
^1 论文标题中使用脏话是有先例的 [5 (https://arxiv.org/html/2503.23923v2#bib.bib5)]。然而,本文将以“什么是人工通用智能”为标题发表在 2025 年 AGI 会议论文集上,因为 Anton 发了脾气。论文的真实名称仍然是“通用人工智能到底是什么鬼”。请按此引用本文。我想把这个脚注献给 Anton 的假正经。干得好,Anton。
2 智能
我将首先定义智能和 AGI。存在多种观点 [6 (https://arxiv.org/html/2503.23923v2#bib.bib6),2 (https://arxiv.org/html/2503.23923v2#bib.bib2),7 (https://arxiv.org/html/2503.23923v2#bib.bib7),8 (https://arxiv.org/html/2503.23923v2#bib.bib8),9 (https://arxiv.org/html/2503.23923v2#bib.bib9),10 (https://arxiv.org/html/2503.23923v2#bib.bib10),11 (https://arxiv.org/html/2503.23923v2#bib.bib11),12 (https://arxiv.org/html/2503.23923v2#bib.bib12)]。有些人将 AGI 等同于在广泛任务中达到人类水平的表现 [13 (https://arxiv.org/html/2503.23923v2#bib.bib13),1 (https://arxiv.org/html/2503.23923v2#bib.bib1)]。这很直观,但过于以人类为中心且难以量化^2 [注2:更准确地说,它太容易被量化了。我们可以用很多方式量化它。它是模糊的,且作为标准过于薄弱,除了填充 Sam Altman 的推文外没什么用处。]。Chollet 认为,智能是衡量泛化和获取新技能能力的指标。他认为 AGI 可以做到至少与人类一样好 [11 (https://arxiv.org/html/2503.23923v2#bib.bib11)]。他试图量化获取新技能的能力,这可以涵盖上述以人类为中心的定义。他的形式化方法类似于 Legg-Hutter 智能。Legg 和 Hutter 认为,智能是在广泛环境中实现目标的能力 [10 (https://arxiv.org/html/2503.23923v2#bib.bib10)]^3 [注3:这将智能视为与目标隐含地可分离,认可了正交性论点 [14 (https://arxiv.org/html/2503.23923v2#bib.bib14)]。]。Chollet 的定义源自 Legg-Hutter。它基于奥卡姆剃刀。两者都使用柯尔莫哥洛夫复杂度。两者都将简洁等同于通用性。两者都试图量化智能,而且两者都非常主观,因为它们将智能视为软件通过解释器与世界交互时的属性 [15 (https://arxiv.org/html/2503.23923v2#bib.bib15),16 (https://arxiv.org/html/2503.23923v2#bib.bib16),17 (https://arxiv.org/html/2503.23923v2#bib.bib17),18 (https://arxiv.org/html/2503.23923v2#bib.bib18)]。
这是一个问题。为什么?因为如果我为了某个目的开发了一个 AI,那么是我决定它是否完成了那个目的,而我是智能体环境的一部分。环境是决定目标成功或失败的地方。假设 (\mathcal{C}) 是软件程序的空间,(\Gamma) 是行为空间。想象 (f_1 \in \mathcal{C}) 是 AI 软件,(f_2: \mathcal{C} \rightarrow \Gamma) 是运行它的硬件,而 (f_3: \Gamma \rightarrow {0,1}) 是决定成功与否的环境(包括我)。成功是 (f_3(f_2(f_1))) 的问题。(f_3(f_2(f_1))) 的行为可以通过改变 (f_2) 或 (f_3) 来改变 [12 (https://arxiv.org/html/2503.23923v2#bib.bib12)]。仅基于 (f_1) 就对 (f_3(f_2(f_1))) 做出断言是毫无意义的。(f_1) 和 (f_2) 就像心灵和身体。每一种具身的选择都会以某种方式使系统产生偏差。它所做的每一个动作都限制了可能性的空间,就像在形式语言中表达的约束一样。复杂度是身体如何解释信息的一种属性 [18 (https://arxiv.org/html/2503.23923v2#bib.bib18)]。通用图灵机的选择可以使任何软件智能体根据 Legg-Hutter 智能达到最优 [17 (https://arxiv.org/html/2503.23923v2#bib.bib17)]。
将 AI 视为软件心灵的观点被称为计算二元论 [12 (https://arxiv.org/html/2503.23923v2#bib.bib12)]^4 [注4:计算二元论基于其他地方给出的冗长形式定义和推导 [19 (https://arxiv.org/html/2503.23923v2#bib.bib19),18 (https://arxiv.org/html/2503.23923v2#bib.bib18),12 (https://arxiv.org/html/2503.23923v2#bib.bib12),20 (https://arxiv.org/html/2503.23923v2#bib.bib20),21 (https://arxiv.org/html/2503.23923v2#bib.bib21)]。对于本文的概述来说,这种形式化程度会适得其反。]。这是对笛卡尔工作的引用,他在 1637 年主张松果体在心灵和身体之间起中介作用。AI 研究者已经用图灵机取代了松果体。那么替代方案是什么?Wang 将智能定义为有限资源下的适应性 [6 (https://arxiv.org/html/2503.23923v2#bib.bib6)]。这为我们避免了二元论留出了空间,并且它隐含了在广泛环境中实现目标的能力 [12 (https://arxiv.org/html/2503.23923v2#bib.bib12)]。
有人尝试解决计算二元论并将智能形式化为客观的适应性。它通过将软件、硬件和环境一起形式化来实现 [12 (https://arxiv.org/html/2503.23923v2#bib.bib12)]。它将智能形式化为完成广泛任务的能力的度量 [21 (https://arxiv.org/html/2503.23923v2#bib.bib21)]。这摒弃了目标与智能的分离,转而采用一个将系统目的视为其所作所为的全局系统模型。一个人的身体蕴含着一组目标和子目标。身体、环境和目标共同构成一个任务,我将其理解为一种目的及其实现方式。如果 (A) 完成了 (B) 完成的超集任务,那么 (A) 比 (B) 更具适应性。这涵盖了样本效率和能源效率。它是指系统适应的速度以及耗能多少。这是我在本文中使用的定义。我认为 AGI 是一个至少与人类科学家同样通用的适应系统 [22 (https://arxiv.org/html/2503.23923v2#bib.bib22)]。一个人工科学家能够确定优先级、规划并执行有用的实验。这需要自主性、能动性、动机、学习因果关系的能力,以及平衡探索(获取知识)与行动(从中获益)的能力 [23 (https://arxiv.org/html/2503.23923v2#bib.bib23),9 (https://arxiv.org/html/2503.23923v2#bib.bib9),8 (https://arxiv.org/html/2503.23923v2#bib.bib8),24 (https://arxiv.org/html/2503.23923v2#bib.bib24),25 (https://arxiv.org/html/2503.23923v2#bib.bib25)]。
人工智能(AI)和机器学习(ML)通常被划分为诸如监督学习、强化学习、回归、分类、规划等类别。这些对于 AGI 来说并非有用的分类,因为人工科学家必须能够做到所有这些事情。相反,我将借鉴 Sutton 的“苦涩教训”。它承认,如果我们扩大资源(计算、内存、数据等),普遍适用的工具可以用于学习任何行为 [26 (https://arxiv.org/html/2503.23923v2#bib.bib26)]。
3 工具
搜索:
非正式地说,我所说的搜索是指系统获取结构,然后在该结构范围内构建一个解决方案。例如,拿到一张地图,然后通过尝试先所有可能的单步组合,再尝试两步、三步等等,直到找到到达目的地的最短转向序列,从而规划一条路线。搜索通常指用于符号推理和规划问题的算法,如 A* [27 (https://arxiv.org/html/2503.23923v2#bib.bib27)]。这些算法涉及将问题和目标描述为一组规则,然后构建可能的行动方案,直到找到满足所有规则的一个。启发式方法用于更快地构建解决方案^5 [注5:启发式的一个例子是一个函数,它接受一个转向序列并告诉你末端距离目的地有多远。]。理论上,任何问题都可以被构建为搜索问题^6 [注6:乍一看,可能会有人反对,说搜索只能应用于定义明确、规则和目标明确的问题。然而,搜索很容易应用于定义不明确的问题。在没有明确定义规则和目标的情况下,搜索可用于从观察到的数据中推断规则和目标。它可以通过将观察到的数据或其子集视为规则,并搜索所有可能标准的空间,直到找到一个能解释部分或全部观察数据的标准来实现这一点 [28 (https://arxiv.org/html/2503.23923v2#bib.bib28),29 (https://arxiv.org/html/2503.23923v2#bib.bib29)]。每件事都可以简化为一个搜索问题,原因与每个命令式程序(如“做这个”之类的指令)都可以转换为等效的声明式程序(如“笔是红色的”这样的断言)大致相同 [30 (https://arxiv.org/html/2503.23923v2#bib.bib30)];这仅仅是一个框架的问题。]。搜索有优点。它产生可验证正确且可解释的答案。它擅长规划 [31 (https://arxiv.org/html/2503.23923v2#bib.bib31)],并且通常用于地图软件。它可以证明定理 [32 (https://arxiv.org/html/2503.23923v2#bib.bib32)]。在 90 年代,搜索击败了国际象棋世界冠军 [33 (https://arxiv.org/html/2503.23923v2#bib.bib33)]。搜索可用于学习,通过遍历可能的假设或模型,直到找到一个符合观察数据的。但它也有缺点。遍历大的状态空间成本很高。可以添加手工定制的约束来缩小搜索空间,但这并不太可扩展。搜索往往是顺序的^7 [注7:在当前的实现中往往如此。但不必如此。],使其不太适合充分利用现代硬件的优势,这些硬件最初是为了并行化图形渲染和游戏中的物理模拟而设计的。直到后来,这种硬件才被用于 AI [34 (https://arxiv.org/html/2503.23923v2#bib.bib34)]。存在并行搜索算法,但仍有很大的改进空间 [35 (https://arxiv.org/html/2503.23923v2#bib.bib35),36 (https://arxiv.org/html/2503.23923v2#bib.bib36),37 (https://arxiv.org/html/2503.23923v2#bib.bib37),38 (https://arxiv.org/html/2503.23923v2#bib.bib38)]。结果是,搜索只有在较高的抽象层次上才真正实用,在这个层次上,问题用少量抽象符号或定义良好的部分来表示。
近似:
Sutton 的“苦涩教训”将搜索的替代方案描述为学习。然而,搜索也可以用于学习 [28 (https://arxiv.org/html/2503.23923v2#bib.bib28)],所以为了避免混淆,我将使用术语近似。无论如何,现代机器学习的大部分都是近似的。典型
相似文章
AGI的定义不断变化,以排除最新模型
关于AGI定义如何随着时间推移而被修订的讨论,通常是为了排除最新AI模型的能力。
@omarsar0: 关于自主AI作为通往AGI的可预见路径的有趣观点论文。(收藏)一直存在激烈争论……
这篇观点论文认为,包含记忆、推理、工具使用、自我改进和对齐的自主AI系统,是比单纯扩展单一模型更可预见的AGI路径,并将这些组件形式化为具有不同瓶颈的可分离轴。
AGI 🚀
本文提及 AGI(通用人工智能),可能是一篇关于 AGI 进展或相关推测的简短帖子或公告,除标题外可获取的内容有限。
@CalcCon: 要真正实现AGI,我们必须超越工程技巧,建立深度学习背后的科学原理……
一位研究者声称利用重整化群理论建立了深度学习背后的科学原理,超越了工程技巧,可能为AGI铺平道路。这项工作基于2021年发表在JMLR和《自然·通讯》上的论文。
衡量通向AGI的进展:一个认知框架
Google DeepMind发布了一篇论文,提出了一个衡量通向通用人工智能(AGI)进展的认知框架,识别了十项关键认知能力,并发起了一场Kaggle黑客马拉松以构建相关评估方法。