大模型绿色化发展综述:从资源高效架构到软硬件协同设计
摘要
本综述全面回顾了面向绿色AI的资源高效架构与软硬件协同设计,涵盖高效模型构建、训练/部署策略以及可持续硬件,旨在指导大模型的可持续发展。
arXiv:2607.09084v1 公告类型:新
摘要:大规模AI模型的快速发展在多个领域带来了显著的性能突破,但也引发了关于计算成本、能耗和环境可持续性的重要担忧。本综述全面概述了大模型的绿色化发展,重点介绍了资源高效架构和全栈软硬件协同设计。我们系统回顾了高效模型构建方面的最新进展,包括注意力算子优化、线性复杂度架构、模型稀疏化与合并,以及训练和部署策略(如数据高效学习、参数高效微调和计算压缩)。除了算法改进,我们还探讨了节能AI硬件,包括主流AI芯片、内存优化、跨平台部署和可持续基础设施。此外,我们研究了大模型如何应用于可持续发展关键领域,例如DeepSeek、遥感解译、国家级基础设施和全球行动计划。最后,我们讨论了关键挑战和未来方向,强调了持续学习范式、以内存为中心的硬件以及标准化评估协议的必要性。本综述旨在为可持续、可扩展和社会负责任的大模型开发提供整体路线图。论文主页:https://cje.ejournal.org.cn/article/doi/10.23919/cje.2025.00.438
查看缓存全文
缓存时间: 2026/07/13 07:58
# 大模型绿色发展综述:从资源高效架构到软硬件协同设计 来源:https://arxiv.org/html/2607.09084 \\volumeyear 2026\\volumenumber35\\issuenumber5\\journalname电子学报(英文版)\\startpage1\\endpage24\\DOI10\.23919/cje\.2025\.00\.438\\journaltype综述\\corrauth李鑫,王耀威\\receivetime稿件收到日期 2025年9月30日\\accepttime接受日期 2026年1月13日\\publishtime在线发表日期 2026年2月7日\\authorcopy名1 中1 姓1*等* 曹桂平\\affilnums1https://orcid.org/0000-0002-0682-2158\{\}^\{\\lx@orcidlink\{0000\-0002\-0682\-2158\}\{\\orcidlogo\}\}郭明月\\affilnums1https://orcid.org/0009-0005-2348-7530\{\}^\{\\lx@orcidlink\{0009\-0005\-2348\-7530\}\{\\orcidlogo\}\}关显超\\affilnums1,2https://orcid.org/0009-0003-1384-0527\{\}^\{\\lx@orcidlink\{0009\-0003\-1384\-0527\}\{\\orcidlogo\}\}杨帆\\affilnums1https://orcid.org/0009-0005-0123-3505\{\}^\{\\lx@orcidlink\{0009\-0005\-0123\-3505\}\{\\orcidlogo\}\}陶明\\affilnums1https://orcid.org/0000-0002-4662-7170\{\}^\{\\lx@orcidlink\{0000\-0002\-4662\-7170\}\{\\orcidlogo\}\} 李鑫\\affilnums1,\*https://orcid.org/0000-0002-1670-1368\{\}^\{\\lx@orcidlink\{0000\-0002\-1670\-1368\}\{\\orcidlogo\}\}彭宇新\\affilnums3https://orcid.org/0000-0001-7658-3845\{\}^\{\\lx@orcidlink\{0000\-0001\-7658\-3845\}\{\\orcidlogo\}\}王耀威\\affilnums2,1,\*https://orcid.org/0000-0002-6110-4036\{\}^\{\\lx@orcidlink\{0000\-0002\-6110\-4036\}\{\\orcidlogo\}\}11机构标注:鹏城实验室,深圳 518066,中国 22机构标注:哈尔滨工业大学(深圳),深圳 518055,中国 33机构标注:北京大学,北京 100080,中国 xinlihitsz@gmail\.com, wangyw@pcl\.ac\.cn (https://arxiv.org/html/2607.09084v1/mailto:[email protected],%[email protected]) ###### 摘要 大规模人工智能模型的快速扩展在多个领域带来了显著的性能突破,但也引发了关于计算成本、能源消耗和环境可持续性的严重关切。本综述全面概述了大模型的绿色发展,重点关注资源高效架构和全栈软硬件协同设计。我们系统性地回顾了高效模型构建的最新进展,包括注意力算子优化、线性复杂度架构、模型稀疏化与融合,以及训练和部署策略,如数据高效学习、参数高效微调和计算压缩。除了算法改进,我们还探索了节能AI硬件,包括主流AI芯片、内存优化、跨平台部署和可持续基础设施。此外,我们研究了大模型如何应用于可持续发展的关键领域,如DeepSeek、遥感解译、国家级基础设施和全球倡议。最后,我们讨论了关键挑战和未来方向,强调了持续学习范式、以内存为中心的硬件和标准化评估协议的必要性。本综述旨在为可持续、可扩展且具有社会责任感的大模型发展提供一份全面的路线图。 ###### 关键词:绿色AI,模型效率,软硬件协同设计,可持续计算,大模型 ## 1 引言 近年来,基于Transformer架构[1 (https://arxiv.org/html/2607.09084#bib.bib1)]的大规模人工智能模型在自然语言处理、计算机视觉和科学计算等领域取得了显著突破。旗舰模型如BERT[2 (https://arxiv.org/html/2607.09084#bib.bib2)]、CLIP[3 (https://arxiv.org/html/2607.09084#bib.bib3)]、LLaVA[4 (https://arxiv.org/html/2607.09084#bib.bib4)]和GPT系列[5 (https://arxiv.org/html/2607.09084#bib.bib5)]不断拓展着人工智能的前沿。然而,这一进展也伴随着巨大的代价:模型参数、训练数据和输入长度的指数级增长导致计算需求急剧上升,造成了巨大的能源消耗和环境问题,如表1 (https://arxiv.org/html/2607.09084#S1.T1)所示。随着模型参数从数十亿扩展到万亿,输入序列从1K扩展到100K个token,训练和推理成本超线性增长,对大规模AI系统的可及性、可扩展性和可持续性构成了重大挑战。111https://cje\.ejournal\.org\.cn/article/doi/10\.23919/cje\.2025\.00\.438 见图注图1:一个三角框架,展示模型架构、训练策略和绿色AI硬件之间的分层关系。表1:训练主流大模型的GPU小时数、能耗和碳足迹比较。†表示无官方数据,数值为估计值,仅供参考。模型 GPU小时数 (h) 能耗 (KWh) 碳排放 (tCO2eq) CLIP 256k V100 71k 24† BLOOM 1,083k A100 475k 183 GPT-3 3,140k∼\\sim4,600k†V100 1,287k† 552† GPT-4o ∼\\sim60,000k†H100 16,800k† 21,660† Gemini 1 40,000k∼\\sim50,000k†TPUv4 8,000k∼\\sim12,000k† 4,000∼\\sim6,000† Gemini 2 12,000k∼\\sim15,000k†TPUv6 3,000k∼\\sim5,000k† 1,500∼\\sim2,500† Qwen3-Max ∼\\sim300,000k†H200 23,000k† - DeepSeek-V3 2,788k H800 1,087k† 584 LLAMA 1,022k A100 449k 173 LLAMA 2 1,720k A100 688k† 291 LLAMA 3 30,840k H100 \>\>11,000k 11,390 SAM 18k A100 7k 3 SAM 3 172k A100 或 86k H200 142k∼\\sim176k 66∼\\sim78 这种低效率的核心在于主流模型的架构设计。Transformer中的注意力机制[1 (https://arxiv.org/html/2607.09084#bib.bib1)]具有O\(N2\)O\(N^\{2\}\)的时间和内存复杂度,造成了众所周知的“二次方墙”,严重限制了长上下文的处理。此外,密集激活范式要求模型中每个参数都参与每次计算,无论其相关性如何,导致计算资源和内存的巨大浪费。这些基础性限制使得前沿模型的训练极其消耗资源:例如,训练一个100K上下文的模型,其成本几乎是训练一个10K上下文模型的近100倍。环境影响同样令人担忧,最近的研究估计,训练单个大型模型产生的碳排放可能相当于多辆汽车全生命周期的排放量[6 (https://arxiv.org/html/2607.09084#bib.bib6)]。 针对这些挑战,已经涌现了许多综述[7 (https://arxiv.org/html/2607.09084#bib.bib7),8 (https://arxiv.org/html/2607.09084#bib.bib8),9 (https://arxiv.org/html/2607.09084#bib.bib9),10 (https://arxiv.org/html/2607.09084#bib.bib10)]。然而,其中大多数[7 (https://arxiv.org/html/2607.09084#bib.bib7),8 (https://arxiv.org/html/2607.09084#bib.bib8),9 (https://arxiv.org/html/2607.09084#bib.bib9)]只关注孤立的技术组件,如参数高效微调、量化或剪枝,而没有提供系统级的视角。特别是,它们常常忽视硬件约束和协同设计策略的作用,并且通常缺乏对新兴技术(如物理启发模型、状态空间建模或模型融合)的覆盖。此外,以往的工作很少探索现实世界的可持续性应用,如遥感或气候建模,在这些领域,高效的AI可以产生切实的环境影响。 为了系统地应对这些挑战,本综述采用了一种自上而下的视角,反映了高效AI系统的逻辑层级和结构依赖关系。如图1 (https://arxiv.org/html/2607.09084#S1.F1)所示,我们将大模型的绿色发展组织成一个三角框架,涵盖三个紧密耦合的层次:(1)顶层关注资源高效架构,模型设计的创新塑造计算模式及其与下游硬件的兼容性;(2)中间层强调训练和部署优化,将算法技术与系统约束联系起来;(3)底层聚焦于软硬件协同设计,其中节能芯片、推理内存优化和协作式跨平台部署支撑上层模型。这种结构不仅是分层的,而且是双向的:架构突破影响芯片设计,而硬件能力则反馈模型结构和优化策略。与以往文献不同,我们提出了一个统一的观点,即效率提升来自于层次间的协作,而非孤立的技术。 如图2 (https://arxiv.org/html/2607.09084#S1.F2)所示,遵循此框架,第2节 (https://arxiv.org/html/2607.09084#S2)综述了架构层面的创新,包括物理启发模型如vHeat[11 (https://arxiv.org/html/2607.09084#bib.bib11)]、状态空间模型如VMamba[12 (https://arxiv.org/html/2607.09084#bib.bib12)]、稀疏技术如混合专家模型,以及模型融合。第3节 (https://arxiv.org/html/2607.09084#S3)聚焦于训练和优化计算,涵盖数据高效学习策略、分布式训练、参数高效微调、模型与计算压缩,如量化、蒸馏和推测解码。第4节 (https://arxiv.org/html/2607.09084#S4)考察绿色AI硬件,强调内存优化、跨平台部署和能源感知硬件系统设计。第5节 (https://arxiv.org/html/2607.09084#S5)将讨论扩展到面向可持续发展的AI,涵盖中国的最新进展如DeepSeek和“天翼·灵眸”3.0系统、国家级基础设施如C2NET,以及由Google、Meta等引领的全球倡议。最后,第6节 (https://arxiv.org/html/2607.09084#S6)讨论未来机遇,包括持续学习、神经形态计算、边缘AI,以及对标准化效率基准的迫切需求。 整体而言,这些章节为新兴的绿色AI图景提供了一个分层且相互关联的视角。通过将模型设计、算法优化和硬件实现整合到一个统一框架中,本综述旨在为开发可扩展、低碳的AI系统提供理论见解和实践指导。我们强调稀疏性、模块化和硬件感知作为跨层次的反复出现的核心原则,并倡导对AI可持续性采取全生命周期视角,从预训练到部署及其他阶段。 总之,本综述通过提供一个统一的、全栈的视角,强调模型设计、优化策略和硬件实现之间的相互依赖关系,为该领域做出了贡献。我们引入了一个三角框架,捕捉了层次间的双向影响,并系统地组织了其中的最新进展。此外,我们强调一个层次的设计决策如何影响其他层次的约束和机遇。通过将广泛的技术综合成一个连贯的观点,我们旨在支持研究人员和实践者应对构建高效、可扩展和可持续的大规模AI系统所涉及的复杂权衡。 \{forest\}图2:论文结构概览,详述第1节 (https://arxiv.org/html/2607.09084#S1)至第7节 (https://arxiv.org/html/2607.09084#S7)。 ## 2 高效模型构建 大规模神经网络的快速进展推动了AI的显著进步,但代价是计算和内存成本的急剧增加。随着模型和上下文长度的增长,传统的Transformer架构遇到了根本性的可扩展性问题,特别是其注意力机制的二次复杂性,这在长序列场景中成为主要瓶颈。本节综述了架构层面的前沿创新,旨在缓解大模型的计算和内存需求。我们聚焦于三个主要研究方向:(1)注意力算子优化;(2)高效模型设计;(3)模型稀疏化与融合。这些方法都试图将模型性能与资源消耗解耦,为可持续和可扩展的AI开发开辟道路。 ### 2.1 注意力算子优化 计算算子是执行张量运算的核心内核,对于提高计算效率至关重要。一个代表性例子是Transformer中的注意力机制,其相对于序列长度的二次复杂性给内存和速度带来了根本性瓶颈。为了克服这些限制,研究已转向硬件感知和效率驱动的算子设计。以下部分重点介绍了几个代表性算子设计。 #### 2.1.1 注意力机制中的二次复杂性 传统注意力机制通过缩放点积注意力公式计算序列中每个位置之间的相关性,实现全局依赖建模:Attention\(Q,K,V\)=softmax\(QKTdk\)V\\operatorname\{Attention\}\(\\bm\{Q\},\\bm\{K\},\\bm\{V\}\)=\\operatorname\{softmax\}\\left\(\\frac\{\\bm\{Q\}\\bm\{K\}^\{T\}\}\{\\sqrt\{d\_\{k\}\}\}\\right\)\\bm\{V\}, 其中Q\\bm\{Q\}(查询)、K\\bm\{K\}(键)和V\\bm\{V\}(值)是输入序列的线性投影。这个过程涉及计算QKT\\bm\{Q\}\\bm\{K\}^\{T\}来生成一个N×NN\\times N的相似度矩阵,对其缩放,应用softmax进行归一化,最后对V\\bm\{V\}向量进行加权。多头自注意力和交叉注意力通过并行运行多个注意力函数来捕获不同的表示,从而扩展了这一机制。然而,核心限制来自QKT\\bm\{Q\}\\bm\{K\}^\{T\}计算,其在计算和内存需求上都具有二次复杂性O\(N2\)O\\left\(N^\{2\}\\right\)。例如,当序列长度从1K增加到32K个token时,注意力矩阵的存储需求增长1024倍,形成了一道严重的“二次方墙”,阻碍了长序列处理。尽管BERT[2 (https://arxiv.org/html/2607.09084#bib.bib2)]、CLIP[3 (https://arxiv.org/html/2607.09084#bib.bib3)]和GPT[57 (https://arxiv.org/html/2607.09084#bib.bib57)]等模型在NLP和视觉任务中取得了成功,但这种复杂性对需要长上下文理解的实际部署场景(如长文档分析、高分辨率图像处理和长视频序列)构成了显著挑战。 #### 2.1.2 线性注意力 针对传统Transformer的二次复杂性挑战,线性注意力[13 (https://arxiv.org/html/2607.09084#bib.bib13)]通过特征映射函数φ\(Q\)\\phi\(\\bm\{Q\}\)和φ\(K\)\\phi\(\\bm\{K\}\)将查询和键矩阵转换为高维特征表示,将计算复杂度从O\(N2\)O\\left\(N^\{2\}\\right\)降低到线性O\(N\)O\(N\)。其核心见解是重新公式化注意力计算,通过应用特征映射(如φ\(x\)=ReLU\(x\)\\phi\(x\)=\\operatorname\{ReLU\}\(x\)或φ\(x\)=ELU\(x\)\+1\\phi\(x\)=\\operatorname\{ELU\}\(x\)\+1)到查询和键上,然后利用矩阵乘法的结合性重新组织计算顺序,避免显式构建注意力矩阵。线性注意力不是计算完整的QKT\\bm\{Q\}\\bm\{K\}^\{T\}注意力矩阵,而是预先计算映射后的键与值的组合,并对每个查询重复使用,从而实现线性复杂度。虽然这种方法理论上可以处理任意长的序列,但Li相似文章
迈向可持续人工智能:深度学习模型碳足迹的综合综述与比较分析
一项系统性综述和实证研究,比较了深度学习模型的碳足迹,考察了绿色AI技术和测量工具,发现训练阶段是排放的主要来源,且更大的架构并不总能带来成比例的精度提升。
@NVIDIAAI: 随着AI模型在规模和能力上不断增长,塑造模型与其大小同等重要。我们正在推出…
NVIDIA推出关于AI模型协同设计(AI Model Co-Design)的系列内容,解释模型维度如何影响GPU性能,以及LLM部署中吞吐量与交互性之间的权衡。第一篇文章提供了设计硬件友好型LLM的实用入门指南,以提升系统吞吐量和用户响应速度。
如此规模的人工智能真的可持续吗?
本文质疑大规模人工智能数据中心的可持续性,探讨其水资源和能源需求,并评估轨道数据中心及效率改进等潜在解决方案。
AI 是否有一天会变得资源高效?
一场关于AI模型长期可持续性的讨论,质疑由于高昂的计算成本和对投资者资金的依赖,探讨资源效率的提升能否防止泡沫破裂。
体育领域大型模型综述
对体育领域大型模型的全面调查,涵盖任务、应用、数据集和挑战,以推动体育智能化。