我们能否优化性能-碳排放盈亏平衡点?:追求更绿色的LLM

arXiv cs.CL 论文

摘要

本文提出了一种碳感知的微调目标,可在任务准确性和推理CO2排放之间取得平衡,并在MMLU科目的Gemma-2 2B、Llama-3.1 8B和Qwen-2.5 14B上进行了测试,发现存在依赖模型和任务的盈亏平衡区域。

arXiv:2608.08744v1 公告类型:新 摘要:任何已部署的大语言模型(LLM)的碳足迹在推理过程中持续累积,因为重复使用模型所产生的成本远超一次性微调的成本。然而,大多数效率干预措施要么针对预训练规模,要么针对事后压缩。我们思考,是否可以将一个经过校准的可微能量代理函数纳入微调目标,从而在零或接近零碳成本下获得任务准确率的推理行为,即一种盈亏平衡配置。我们提出了一种联合损失机制,包含每个模型的碳排放参数、基于参数范数的线性代理、FLOP代理和内存代理,这些代理根据硬件能耗分析进行拟合。我们对三个架构不同的模型族进行了微调:Gemma-2 2B、Llama-3.1 8B和Qwen-2.5 14B,并在MMLU的三个科目(抽象代数、哲学和形式逻辑)上评估了推理F1和CO$_2$排放。从多个实验结果中我们发现,碳项的行为要么是有害干扰,要么是有益正则化,具体取决于任务结构。我们将校准后的碳感知微调定位为一种轻量级、即插即用的正则化器,其盈亏平衡区域非空但依赖于模型和任务。这是一项正在进行的工作,我们将很快发布代码库。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:09

# 我们能否优化性能与碳排放的盈亏平衡点?:追求更绿色的LLM
来源:https://arxiv.org/html/2608.08744
Sourav Das\* IIIT Kalyani sourav\_phd21@iiitkalyani\.ac\.in &Tanmay Joshi\* BITS Pilani Goa f20231102@goa\.bits\-pilani\.ac\.in &Kripabandhu Ghosh IISER Kolkata kripa\.ghosh@gmail\.com

###### 摘要

任何已部署的大语言模型 \(LLM\) 的碳足迹都会在推理过程中不断累积,因为模型的重复使用量远超一次性微调的成本。然而,大多数效率优化手段要么针对预训练规模,要么针对事后压缩。我们提出的问题是:能否将经过校准的可微能量代理纳入微调目标,从而在零或接近零的碳排放成本下获得任务准确率的提升,即达到一种“盈亏平衡”配置。我们提出一种联合损失机制,其中包含一个逐模型的碳排放参数、一个基于参数范数、FLOP 代理和内存代理的线性代理,并通过硬件上的能量剖析进行拟合。我们对三个架构不同的模型族进行了微调:Gemma-2 2B、Llama-3.1 8B 和 Qwen-2.5 14B,并在三个 MMLU 科目(抽象代数、哲学和形式逻辑)上评估推理 F1 和 CO2排放。我们从多个实验结果中发现,碳项的作用取决于任务结构,既可能表现为有害干扰,也可能表现为有益的正则化。我们将经过校准的碳感知微调定位为一种轻量级、即插即用的正则化器,其盈亏平衡区域非空,但依赖于模型和任务。这是一项正在进行的工作,我们将很快发布代码库。

# 我们能否优化性能与碳排放的盈亏平衡点?:追求更绿色的LLM

Sourav Das\*IIIT Kalyanisourav\_phd21@iiitkalyani\.ac\.inTanmay Joshi\*BITS Pilani Goaf20231102@goa\.bits\-pilani\.ac\.inKripabandhu GhoshIISER Kolkatakripa\.ghosh@gmail\.com

††footnotetext:\*这些作者贡献相同。## 1引言

参考图注图1:碳-准确率盈亏平衡区域。每个标记是一个(模型族,MMLU科目)对,展示了我们联合损失模型相对于交叉熵基线的推理Δ\\DeltaF1和相对Δ\\DeltaCO2。左上象限中的点是严格的帕累托改进;虚线标记零碳增量。九个点中有五个位于盈亏平衡区域内(Δ\\DeltaF1≥0\\,\\geq\\,0且Δ\\DeltaCO≤2\+2%\{\}\_\{2\}\\,\\leq\\,\+2\\%),其中包括Qwen-14B / 抽象代数上的一个严格帕累托改进(第3节 (https://arxiv.org/html/2608.08744#S3))。LLM的碳足迹在其整个运行生命周期中累积,而不是在训练时刻一次性产生。前沿LLM只会被微调几次,但在生产环境中会执行更多的前向传播。最近的测量和核算研究表明,对于广泛使用的系统,长期环境成本主要由推理而非训练决定(Patterson等人,2021 (https://arxiv.org/html/2608.08744#bib.bib1);Wu等人,2022 (https://arxiv.org/html/2608.08744#bib.bib2);Luccion等人,2024 (https://arxiv.org/html/2608.08744#bib.bib3))。然而,社区的反应仍然集中在生命周期的两个端点。训练期间的工作追求更好的扩展定律和参数高效适配(Hoffmann等人,2022 (https://arxiv.org/html/2608.08744#bib.bib7);Hu等人,2022 (https://arxiv.org/html/2608.08744#bib.bib8);Dettmers等人,2023 (https://arxiv.org/html/2608.08744#bib.bib9));训练后的工作则针对冻结的产物进行量化、剪枝、蒸馏和解码加速(Frantar等人,2023 (https://arxiv.org/html/2608.08744#bib.bib12);Frantar和Alistarh,2023 (https://arxiv.org/html/2608.08744#bib.bib15);Xiao等人,2023 (https://arxiv.org/html/2608.08744#bib.bib13);Leviathan等人,2023 (https://arxiv.org/html/2608.08744#bib.bib19);Sun等人,2024 (https://arxiv.org/html/2608.08744#bib.bib16))。而微调目标本身——这个决定部署模型在每次后续查询中会使用哪些计算路径的机制——实际上仍然是一片“碳中性”的领域。

我们认为这是一个被错过的杠杆点。微调过程中选择的损失函数悄然决定了模型在推理时的电路使用方式,而在此阶段插入一个经过校准的能量项,可以在不修改架构、精度或解码流程的情况下,引导模型走向更低成本的路径。五年前,可微的硬件感知神经架构搜索在视觉领域确立了这一原则,它将FLOP和延迟代理嵌入搜索目标,无需任何事后压缩步骤即可获得准确且低能耗的模型(Wu等人,2019 (https://arxiv.org/html/2608.08744#bib.bib21);Cai等人,2019 (https://arxiv.org/html/2608.08744#bib.bib22);Tan等人,2019 (https://arxiv.org/html/2608.08744#bib.bib23))。据我们所知,对于LLM,将可微的、基于硬件的能量代理纳入微调损失本身的相应做法尚未被研究。现有的碳感知LLM工作主要是测量和报告排放(Strubell等人,2019 (https://arxiv.org/html/2608.08744#bib.bib5);Schwartz等人,2020 (https://arxiv.org/html/2608.08744#bib.bib6);Luccion等人,2023 (https://arxiv.org/html/2608.08744#bib.bib4)),但并未在训练时针对它们进行优化。

我们的论文提出了一个明确的核心研究问题:*任务性能与推理碳排放的联合优化能否达到盈亏平衡点?*这里的*盈亏平衡*指的是这样的工作点:下游任务F1保持或提升,同时推理CO2不高于标准交叉熵基线。我们对三个架构不同的模型族进行了微调:Gemma-2-2B(Gemma Team等人,2024 (https://arxiv.org/html/2608.08744#bib.bib24))、Llama-3.1-8B(Grattafiori等人,2024 (https://arxiv.org/html/2608.08744#bib.bib25))和Qwen-2.5-14B(Yang等人,2024 (https://arxiv.org/html/2608.08744#bib.bib26)),并在三个MMLU科目(Hendrycks等人,2021 (https://arxiv.org/html/2608.08744#bib.bib27))——抽象代数、哲学和形式逻辑——上评估推理F1和CO2。

图1 (https://arxiv.org/html/2608.08744#S1.F1)表明盈亏平衡区域非空,但具有选择性。Qwen-14B在抽象代数上实现了严格的帕累托改进,F1提升3.53.5个点,同时推理CO2降低3.5%3.5\\%。Gemma-2B在哲学上获得12.812.8个F1点提升,且碳增量基本为零;Llama-8B在形式逻辑上获得5.35.3个F1点提升,碳增加1.8%1.8\\%,这是一个每查询F1收益显著超过边际排放成本的区间。综合来看,这些结果表明,碳感知微调最好被理解为一个结构性正则化器,而非一种统一的效率干预手段,其效果受目标任务规模的影响。据我们所知,此前没有任何工作尝试将一组预训练LLM的可微能量代理纳入微调损失,以在任务准确率和推理CO2排放之间寻找到盈亏平衡配置。

我们在这项工作中有四个新贡献,两个主要贡献和两个次要贡献:

1. 1\.我们引入了LLM的*校准碳感知微调*:一个即插即用的联合损失,直接将从特定训练模型在硬件上的剖析中拟合得到的可微能量代理添加到任务目标中(第2.1节 (https://arxiv.org/html/2608.08744#S2.SS1),第2.2节 (https://arxiv.org/html/2608.08744#S2.SS2))。
2. 2\.在三个模型族和三个MMLU科目中,我们找到了一个包含严格帕累托改进的非空盈亏平衡区域,证明该区间在实践中是可达的(第3.1节 (https://arxiv.org/html/2608.08744#S3.SS1))。
3. 3\.通过在Qwen-14B上对SQuAD和BoolQ进行λ\\lambda敏感性研究,我们表明最优碳惩罚取决于任务结构,这重新将λ\\lambda定义为一个在任务间解释会发生变化的正则化器(附录A.2 (https://arxiv.org/html/2608.08744#A1.SS2))。
4. 4\.我们发布所有配置的逐步训练历史、校准表、推理时排放日志和MMLU预测文件,以便下游复现(附录A.11 (https://arxiv.org/html/2608.08744#A1.SS11))。

## 2方法

我们提出λ\\lambda作为碳正则化系数。在Qwen-14B上进行的一项受控λ\\lambda敏感性研究进一步表明,最优惩罚取决于任务结构:在SQuAD(Rajpurkar等人,2018 (https://arxiv.org/html/2608.08744#bib.bib28))上λ∗=0\\lambda^\{\*\}=0,因为碳项会与抽取式跨度选择产生有害干扰;而在BoolQ(Clark等人,2019 (https://arxiv.org/html/2608.08744#bib.bib29))上λ∗=0.1\\lambda^\{\*\}=0.1,因为同一碳项在布尔推理中充当有益的正则化器。综合来看,这些结果表明,碳感知微调最好被理解为一个结构性正则化器,而非一种统一的效率干预手段,其效果受目标任务几何形状的影响。

### 2.1联合碳感知目标

我们在联合目标下微调一个具有参数θ\\theta的预训练语言模型:

Ljoint\(θ\)=Ltask\(θ\)\+λ⋅C^\(θ\)\+μ⋅Lreg\(θ\),\\mathcal\{L\}\_\{\\text\{joint\}\}\(\\theta\)\\;=\\;\\mathcal\{L\}\_\{\\text\{task\}\}\(\\theta\)\\;\+\\;\\lambda\\cdot\\hat\{C\}\(\\theta\)\\;\+\\;\\mu\\cdot\\mathcal\{L\}\_\{\\text\{reg\}\}\(\\theta\),\(1\)
其中Ltask\\mathcal\{L\}\_\{\\text\{task\}\}是目标数据集上的标准词元级交叉熵损失,C^\(θ\)\\hat\{C\}\(\\theta\)是逐步推理能量的可微代理,Lreg\(θ\)\\mathcal\{L\}\_\{\\text\{reg\}\}\(\\theta\)是正则化损失,λ,μ∈R≥0\\lambda,\\mu\\in\\mathbb\{R\}\_\{\\geq 0\}分别控制碳项和正则化项的强度。设置λ=μ=0\\lambda=\\mu=0即恢复交叉熵基线;正的λ\\lambda将最优点移向代理预测的前向传播成本更低的参数配置,而正的μ\\mu则增加训练过程中正则化的影响。由于C^\(θ\)\\hat\{C\}\(\\theta\)和Lreg\(θ\)\\mathcal\{L\}\_\{\\text\{reg\}\}\(\\theta\)都对θ\\theta可微,额外项在每个优化步骤都会贡献梯度,整个目标使用标准一阶方法进行训练。

### 2.2代理校准

该代理是一个逐模型的关于网络状态的三个可微且可即时计算特征的线性函数:参数的L2范数(φ1=‖θ‖2\\phi\_\{1\}=\\\|\\theta\\\|\_\{2\})、由前向传播张量形状计算得到的FLOP代理(φ2\\phi\_\{2\})以及反映峰值激活占用量的内存代理(φ3\\phi\_\{3\})。具体而言,

C^\(θ\)=w1φ~1\(θ\)\+w2φ~2\(θ\)\+w3φ~3\(θ\),\\hat\{C\}\(\\theta\)\\;=\\;w\_\{1\}\\tilde\{\\phi\}\_\{1\}\(\\theta\)\+w\_\{2\}\\tilde\{\\phi\}\_\{2\}\(\\theta\)\+w\_\{3\}\\tilde\{\\phi\}\_\{3\}\(\\theta\),\(2\)
其中φ~i\\tilde\{\\phi\}\_\{i\}表示按校准集尺度归一化后的特征,wiw\_\{i\}是逐模型拟合的非负权重。这些权重的获得方式是:在三个参考批大小(B∈\{128,256,384\}B\\in\\\{128,256,384\\\},对于允许更大批大小的较小模型使用B∈\{128,256,512\}B\\in\\\{128,256,512\\\})上运行预训练模型,通过CodeCarbon(Courty等人,2024 (https://arxiv.org/html/2608.08744#bib.bib30))测量硬件上的能量,并针对三个归一化特征求解能量对它们的非负最小二乘拟合。得到的权重随后在整个微调过程中保持固定。

表1:代理校准。归一化权重(w1,w2,w3w\_\{1\},w\_\{2\},w\_\{3\})分别对应参数范数、FLOP代理和内存代理。R2R^\{2\}是在三点校准集上计算的。模型w1w\_\{1\}w2w\_\{2\}w3w\_\{3\}R2R^\{2\}Gemma-2-2B0.0001.0000.0000.974Llama-3.1-8B0.0001.0000.0000.663Qwen-2.5-14B0.9880.0000.0121.000

拟合代理有两个值得注意的性质,在表1 (https://arxiv.org/html/2608.08744#S2.T1)中可见。首先,权重集中度依赖于模型族:Llama和Gemma将所有权重放在FLOP代理上,而Qwen几乎将所有权重放在参数范数上。这种不对称性反映了不同架构中L2范数的参数规模差异巨大(Llama和Gemma约为10310^\{3\},而Qwen-2.5-14B约为2×10−22\\times 10^\{\-2\}),这是由逐模型拟合吸收的,而非人为施加。其次,校正是基于三个工作点拟合的,因此报告的R2R^\{2\}值描述的是样本内拟合,不应被解读为跨批大小广泛泛化的证据;我们将代理视为局部可信的惩罚函数,而非全局能量预测器,并在第A.12节 (https://arxiv.org/html/2608.08744#A1.SS12)中将这一范围讨论为局限性。

### 2.3实验设置

#### 模型。

我们微调了三个架构不同的预训练检查点:Gemma-2-2B(Gemma Team等人,2024 (https://arxiv.org/html/2608.08744#bib.bib24))、Llama-3.1-8B(Grattafiori等人,2024 (https://arxiv.org/html/2608.08744#bib.bib25))和Qwen-2.5-14B(Yang等人,2024 (https://arxiv.org/html/2608.08744#bib.bib26))。每个模型被微调两次:一次使用λ=0\\lambda=0(交叉熵基线),一次使用联合目标,其中逐模型λ\\lambda通过一个小型验证集扫描λ∈\{0.01,0.03,0.1\}\\lambda\\in\\\{0.01,0.03,0.1\\\}\(扫描结果见附录A.5 (https://arxiv.org/html/2608.08744#A1.SS5))来选择。

#### 任务与评估。

下游评估在MMLU基准(Hendrycks等人,2021 (https://arxiv.org/html/2608.08744#bib.bib27))的三个科目上进行:*抽象代数*、*哲学*和*形式逻辑*,这些科目涵盖数学、人文学科和符号推理。对于每个(模型,科目)对,我们报告宏F1和推理CO2排放,两者均在相同的解码设置和硬件下计算。对于第A.2节 (https://arxiv.org/html/2608.08744#A1.SS2)中的λ\\lambda敏感性研究,我们另在SQuAD v2(Rajpurkar等人,2018 (https://arxiv.org/html/2608.08744#bib.bib28))和BoolQ(Clark等人,2019 (https://arxiv.org/html/2608.08744#bib.bib29))上微调Qwen-2.5-14B,覆盖λ∈\[0,1\]\\lambda\\in\[0,1\]的十二个值。

#### 测量。

能量和排放通过CodeCarbon在固定的电网碳强度0.369473kgCO2/kWh0.369473~\\mathrm\{kg\\,CO\_\{2\}/kWh\}下记录,该值与训练区域相关;这个常数在第3节 (https://arxiv.org/html/2608.08744#S3)中报告的所有相对比较中都会抵消。各λ\\lambda值下的训练侧排放均在测量噪声范围内(第3节 (https://arxiv.org/html/2608.08744#S3)),因此主文中的所有碳比较均指MMLU评估过程中的*推理时*排放。

## 3结果

我们围绕第1节 (https://arxiv.org/html/2608.08744#S1)的研究问题组织结果,分三个阶段回答。第3.1节 (https://arxiv.org/html/2608.08744#S3.SS1)报告了三个模型族在各科目上的MMLU比较,并识别出位于盈亏平衡区域内的操作点。第3.2节 (https://arxiv.org/html/2608.08744#S3.SS2)用预测级示例来支撑总体指标。第A.2节 (https://arxiv.org/html/2608.08744#A1.SS2)通过对Qwen-2.5-14B的λ\\lambda敏感性研究,考察了最优点如何随任务结构变化这一次要结果。

表2:各科目MMLU比较。CE

相似文章

我针对 Gemma 4 和 Qwen 3.5 的 30B 级别模型进行了一项实验,旨在探究能耗与性能的权衡关系。换句话说,我想弄清楚哪些模型在输出同等质量的回答时会消耗更多的电能。

Reddit r/LocalLLaMA

针对四款 30B 级别的稠密模型与 MoE 模型的实证研究显示,Gemma-4 26B MoE 在处理相同推理任务时,仅需 1.9–15 Wh 的能耗即可实现同等精度;而稠密模型及更大规模的 MoE 变体在该场景下的功耗最高可达 34 Wh。

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。

大模型推理的二维早退优化

arXiv cs.CL

作者提出一种二维早退方法,同时裁剪层与输入句子,在 Llama 3.1/3.2、Gemma 与 Qwen 模型的情感任务上额外获得 1.4–2.3 倍加速。