认知Kardashev等级:量化文明计算的物质边界

arXiv cs.AI 论文

摘要

本文提出了一种认知Kardashev等级,该等级根据文明持续的AI级计算能力(通过总功率和效率计算)对文明进行排序。当前人类文明的位置约为K≈0.73,并探讨了未来的扩展路径。

arXiv:2605.22840v1 Announce Type: cross 摘要:一个文明能进行多少思考?Kardashev(1964)的类型学根据总功率对文明进行分级:行星级(I型,约10^16 W),恒星级(II型,约10^26 W),银河级(III型)。本文构建了一个类似的认知Kardashev等级:每一级能支撑多少持续的AI级计算。计算涉及四个要素:总功率P(瓦特),其中用于认知的份额f,能量转化为计算(每焦耳操作数)的效率$\eta$,以及作为参考单位的大脑自身处理速率$C_{\mathrm{brain}}$。以2024-2026年的硬件(El Capitan、NVIDIA Blackwell、Vera Rubin)为基准,得到$\eta_{2026} = 10^{12}$ FLOP/J。当前人类文明处于$K \approx 0.73$,即已走完通往I型道路的四分之三。在I型且$f = 1\%$的情况下,可用计算量在数量级上相当于每位人类居民拥有一台个人AI的认知能力;在II型时,其规模则基本上难以理解。报告了到2035年前沿计算的三条轨迹,作为条件性预估,而非预测。长期约束是能量还是效率,取决于尚未做出的工程选择;而谁有获取权这一政治经济学问题可能比两者都更重要。
查看原文
查看缓存全文

缓存时间: 2026/05/25 09:01

# 量化文明计算的材料边界
来源:https://arxiv.org/html/2605.22840
## 认知卡尔达肖夫指数:量化文明计算的材料边界

###### 摘要

一个文明能进行多少思考?卡尔达肖夫(1964 [(https://arxiv.org/html/2605.22840#bib.bib4)])的类型学根据总功率对文明进行排名:行星级(I型,∼10¹⁶W)、恒星级(II型,∼10²⁶W)、星系级(III型)。本文构建了一个类似的**认知卡尔达肖夫指数**:每个等级能支持多少持续的人工智能级计算。计算涉及四个要素:总功率P(瓦特)、分配给认知的份额f、能量转化为计算的效率η(每焦耳的操作数),以及大脑自身的处理速率C_brain(作为参考单位)。以2024-2026年的硬件(El Capitan、NVIDIA Blackwell、Vera Rubin)为锚点,得到η_2026 = 10¹² FLOP/J。当代人类位于K≈0.73,即离I型还有四分之一的路程。在I型和f=1%的情况下,可用的计算量(按数量级计)相当于每位人类居民拥有一个人工智能个人的认知能力;在II型下则基本上难以理解。本文报告了到2035年前沿计算的三种轨迹,作为条件性预测,而非绝对预测。长期约束是能量还是效率,取决于尚未做出的工程选择;谁有权获取计算的政治经济因素可能比这两者都更重要。

## 1 引言

人类已经生活在一个扩展的认知系统中,其能源足迹可与中等规模国家相媲美。2024年,全球数据中心消耗了约415太瓦时的电力,预计到2030年将大致翻倍[国际能源署,2025 [(https://arxiv.org/html/2605.22840#bib.bib17)])。一次前沿AI训练运行在数周内消耗的功率相当于一个小城市。执行这些计算主要份额的硬件机架——NVIDIA的Vera Rubin平台,将于2026年进入量产阶段,每个加速器约50 PFLOP/s(稀疏FP4)——正在部署于垂直整合的、价值千亿美元的财团中,其宣布的基础设施投资(Stargate、Terafab)超过了人类历史上任何先前的工业建设[OpenAI, 2025a [(https://arxiv.org/html/2605.22840#bib.bib24)];Carlson和Grush, 2026 [(https://arxiv.org/html/2605.22840#bib.bib26)])。本文提出的问题不是这类投资是否会发生——它们正在发生——而是它们原则上能支持多大的认知能力,以及这种能力如何随着能源预算的增长而扩展。

卡尔达肖夫(1964 [(https://arxiv.org/html/2605.22840#bib.bib4)])提出按总能耗对文明进行分类:I型文明掌控行星从其母星接收到的能量(∼10¹⁶W);II型文明掌控其恒星的完全光度(∼10²⁶W);III型文明掌控一个星系(∼10³⁷W)。最初的类型学是为SETI设计的,侧重于一个文明的能源输出能否在星际距离上被探测到。卡尔·萨根后来将这个指标细化为一个连续的对数指数K = (log₁₀P - 6)/10,根据2024年一次能源消耗约为2×10¹³W [国际能源署,2024 [(https://arxiv.org/html/2605.22840#bib.bib18)]),当代人类位于K≈0.73。按照萨根的标准,人类已经走完了从前工业化基线(K=0)到掌握行星完整能源预算(K=1)大约四分之三的路程。

原始的卡尔达肖夫指标仍然是一个能量和可探测性类型学,本文不修改它。而是构建一个类似的框架——我称之为**认知卡尔达肖夫指数**——它与卡尔达肖夫的原始等级并行运行,但以计算单位而非纯粹的能量单位进行校准。本文的贡献是校准,而非新的理论构建:它报告了在每个卡尔达肖夫等级下,给定一个可靠的2024-2026效率锚点,所能支持的持续机器学习级计算总量(以每秒浮点运算计)。计算很简单。取一个文明可用的总功率P(以瓦特计,即焦耳/秒)。一个文明不会把所有功率都用于思考;它还需要种粮食、运行工厂、运送人员、供暖建筑。设f为分配给认知的份额。计算消耗能量,但效率在稳步提高:设η为系统将焦耳能量转化为计算操作(每焦耳的操作数)的速率。那么可用的认知吞吐量为

C_cog = f P η (每秒操作数)   (1)

这是本文报告的主要量。为了让结果更直观,而不是仅仅一个巨大的数字,我还将C_cog用人类大脑等效单位表示,除以C_brain(大脑自身的处理速率,以每秒操作数计)。次要量N = C_cog / C_brain,报告时带有明确的不确定性:关于C_brain的文献范围从10¹⁵到10¹⁷ FLOP/s,具体取决于哪些神经事件被计为“操作”,因此大脑等效计数至少带有±1个数量级的不可约不确定性。我将其用作一个可解释的比较器——一个标尺——而不是字面意义上声称那么多FLOP/s的硅能复制人类思维。因此,认知-卡尔达肖夫框架和原始的卡尔达肖夫指标是互补的:前者指示在给定卡尔达肖夫等级的能源预算下,原则上能支持多少持续机器学习级计算,同时保持后者的能量类型学不变。

本文组织如下。第2节 [(https://arxiv.org/html/2605.22840#S2)] 将效率参数η锚定于2024-2026年的硬件数据,比较了从持续的科学FP64超级计算到兰道尔热力学极限的六类工作负载。第3节 [(https://arxiv.org/html/2605.22840#S3)] 采用了一个中心生物学基线估计。第4节 [(https://arxiv.org/html/2605.22840#S4)] 建立了地球2024-25基线。第5节 [(https://arxiv.org/html/2605.22840#S5)] 计算了I型、II型和III型的认知包络并呈现了该指标。第6节 [(https://arxiv.org/html/2605.22840#S6)] 报告了在现实分数分配下的人均能力。第7节 [(https://arxiv.org/html/2605.22840#S7)] 提出了前沿训练计算的三种未来情景,并将其与当前基础设施投资联系起来。第8节 [(https://arxiv.org/html/2605.22840#S8)] 讨论了参数敏感性。第9节 [(https://arxiv.org/html/2605.22840#S9)] 讨论了该指标关于认知计算政治经济学的说明与未说明之处,第10节 [(https://arxiv.org/html/2605.22840#S10)] 得出结论。

## 2 2026年的计算效率

相关效率(以每焦耳电输入的浮点运算表示)大致跨越十二个数量级,从持续的科学计算到近期ML加速器,再到兰道尔热力学极限(表1 [(https://arxiv.org/html/2605.22840#S2.T1)];图1 [(https://arxiv.org/html/2605.22840#S2.F1)])。

**表1:2026年计算效率η,按工作负载类别划分。“持续”指顶级HPL基准测试;“峰值ML”指供应商报告的设计功率下稀疏张量核心吞吐量。**

**图1:按工作负载类别划分的计算效率η,2024-2026年。**
**对数水平轴上的条形图。持续科学计算(FP64)与峰值ML推理(FP4)之间大约两到三个数量级的差距反映了向低精度算术的转变;峰值ML推理与生物大脑效率上限之间进一步的多达两个数量级的差距,界定了在单个系统层面上生物学相对于硅所保持的能效优势;而大脑与300K下兰道尔极限之间大约六个数量级的差距,记录着热力学最优计算可用的提升空间。表2 [(https://arxiv.org/html/2605.22840#S5.T2)]–3 [(https://arxiv.org/html/2605.22840#S6.T3)] 中的任何值都未接近该极限。**
**兰道尔条目是每焦耳不可逆比特操作数,由1/(k_B T ln 2) = 3.48×10^20 在T=300K时给出 [(Landauer, 1961 [(https://arxiv.org/html/2605.22840#bib.bib7)])]。其他行是每焦耳浮点运算数。由于一次双精度或半精度FLOP对应内部状态翻转的许多比特操作,因此引用的每焦耳FLOP的兰道尔极限远小于每焦耳比特操作数;不同行之间的比较是定性的,而非严格可通约的。Lloyd [(2000 [(https://arxiv.org/html/2605.22840#bib.bib8)])] 在质能系统中建立了更高的信息处理物理界限,它们仍然超出了表1中的值。**

关于Blackwell与Rubin过渡的两点值得强调。首先,Rubin的每芯片FLOP/J数字并不严格高于Blackwell,因为每个加速器的TDP从约1kW(B200)上升到约1.8–2.3kW(R200)。Rubin声称的效率优势在机架和推理吞吐量级别上得以实现,那里更大的HBM4内存带宽(约22TB/s vs B200上的约8TB/s)和更紧密的NVLink结构大大降低了数据移动开销 [NVIDIA Corporation, 2026 [(https://arxiv.org/html/2605.22840#bib.bib23)])。其次,表1中的层级在工作负载精度上内部一致:从FP64到FP4的每一步,效率翻倍到四倍,大致符合供应商声称的每次精度减半2-4倍的说法,前提是正确计入内存和利用率开销。

对于本文的认知重新计算,相关效率是将能量转化为机器学习级计算的速率,因为当前和近未来系统中讨论的认知绝大多数以FP16或更低精度执行。我采用

η_2026 = 1 × 10¹² FLOP/J

作为可靠的2026年锚点。这大约比B200峰值稀疏FP16低一个数量级,比R200峰值稀疏FP8低一个数量级,因为真实工作负载包括数据移动、内存访问、网络流量、冷却开销和利用率损失,这些使持续效率远低于供应商峰值 [Strubell 等人,2019 [(https://arxiv.org/html/2605.22840#bib.bib16)])。这也与Blackwell和Rubin级系统生产规模推理的每焦耳令牌数效率报告大致一致,在计入内存和结构开销后,有效FLOP/J落在10¹²到10¹³范围内。

按照这一标准,生物大脑每焦耳的效率仍比当前持续的数字ML基板高出约1.5到3.5个数量级。感受这个差距的一个有用方式:一个运行在约20瓦特(大致相当于一个昏暗白炽灯泡的功率)的人类皮层,在相同类型的模式识别任务上,胜过几百到几千瓦特的当代AI硬件。经过十多年的不懈进步,人类所知的最有效率的计算机仍然是人类与生俱来的那个。这个余量为什么重要有两个原因。首先,它界定了任何数字认知架构原则上能将多少卡尔达肖夫能源预算转化为有用的思维,相对于一个假设的生物基板。其次,这意味着未来几十年的“效率进步”有一个明确的目的地:弥合硅与皮层之间的差距。工程学能否实现这一目标——还是远远停滞不前——是决定文明认知的约束是能量还是效率的开放经验问题。对η的敏感性是1:1的,在第8节中探讨。

## 3 大脑参考值

突触计数和分子状态分析将人类皮层突触数量归因于大约10¹⁴到10¹⁵,每个突触约有4.7个可分辨状态 [Bartol 等人,2015 [(https://arxiv.org/html/2605.22840#bib.bib9)];Drachman, 2005 [(https://arxiv.org/html/2605.22840#bib.bib10)])。采用数量级估计:

M_brain ≈ 10¹⁵ 字节。

对于处理能力,估计值从10¹⁵到10¹⁷次操作/秒不等,具体取决于将神经事件计为“操作”的层级 [Levy and Calvert, 2021 [(https://arxiv.org/html/2605.22840#bib.bib11)];Sandberg and Bostrom, 2008 [(https://arxiv.org/html/2605.22840#bib.bib12)])。文献中“操作”的使用比较松散;到浮点运算的映射不可避免地是近似的。我采用一个中心值:

C_brain = 10¹⁶ FLOP/s,

符合计算神经科学的综述,这些综述将突触事件计为浮点运算,并调整了约95%的神经能量用于通信而非乘积累加的计算等效物这一事实 [Levy and Calvert, 2021 [(https://arxiv.org/html/2605.22840#bib.bib11)])。本文中的大脑等效计数应理解为带有来自此来源的±1个数量级不可约不确定性;所有参数的完全传播在第8节中报告。采用的惯例是,“大脑等效物”是一个可解释的参考单位,而不是字面上声称C_brain FLOP/s的数字计算能复制人类思维。全脑模拟 [Sandberg and Bostrom, 2008 [(https://arxiv.org/html/2605.22840#bib.bib12)]) 将需要此处未涉及的结构和数据条件。¹

¹ 作为一个内存侧比较器,2024年全球数据球达到约1.75–2.0×10²³字节,而每个皮层M_brain≈10¹⁵字节,比率为约10⁸。我不进一步使用这个比较:本文的认知主张涉及处理吞吐量,而非存储。

C_brain的一百倍跨度本身就值得停顿思考。文献范围从10¹⁵到10¹⁷ FLOP/s,不是因为有研究马虎、有研究细心,而是因为“大脑做多少计算?”这个问题没有规范答案:它取决于你是只计数穿过突触的尖峰事件,还是还包括这些尖峰上游的树突整合,或者更慢的神经调节和胶质动力学。单个皮层表示什么,其范围有两个数量级,这是一个令人谦卑的提醒,提醒我们关于认知还有多少未知。因此,大脑等效物是一个故意粗略的标尺——一种问“这个FLOP数量对应于一个思维,还是一百万个思维,还是一万亿个?”的方式——而不是一个精确的翻译。在本文的其余部分,我使用中心值并报告范围;读者应将关于特定大脑等效计数的结论视为在十倍因子内有效,而关于卡尔达肖夫等级定性排序的结论视为稳健的。

## 4 地球2024-25基线

相似文章

狭窄的“最大动压”窗口:为何智能必须加大油门,而非减速

Reddit r/singularity

# 狭窄的窗口:为何智能必须加大油门,而非减速 来源:[https://futureoflife.substack.com/p/the-narrow-window-why-intelligence](https://futureoflife.substack.com/p/the-narrow-window-why-intelligence) 火箭分阶段进入轨道。每一级燃烧掉再也无法使用的燃料,把剩余部分推高一点,然后脱落。第一级在最稠密的大气中承担最繁重的工作;第二级则利用第一级创造的条件——更稀薄的大气——继续推进。

超越人类尺度的智能测量

arXiv cs.AI

本文提出了一种新的范式,用于测量超越人类能力的智能,采用对抗性心理测量评分系统,其中模型生成挑战以区分其他系统,从而实现与AI能力同步扩展的评估。

[2511.07885] 每瓦智能:测量本地AI的智能效率

Reddit r/LocalLLaMA

本文首次系统研究了不同模型和硬件的本地AI推理效率,测量了每瓦智能,并显示从2023年到2025年效率提升了5.3倍,表明有可能重新分配对集中式基础设施的需求。

AI 的未来是什么?

Reddit r/ArtificialInteligence

探讨当前AI系统在能源和基础设施方面不可持续的需求,并探索新的数学、材料或量子计算等潜在替代方案。

AI功耗墙:为何边际芯片微缩无法解决能源悖论

Reddit r/ArtificialInteligence

文章讨论了‘AI功耗墙’现象,即计算增长超过效率提升,并提出了四个范式转变——神经形态计算、光子计算、以内存为中心的计算和近似计算——以实现可持续的AI发展,同时推广了即将举行的‘Watt Matters in AI’会议,该会议关注全栈能源削减。