Green BOA:确定基于机器学习的数据压缩的环境收支平衡点

arXiv cs.LG 论文

摘要

本文分析了基于机器学习的数据压缩的环境收支平衡点,估算了训练和推理的碳当量成本,并与减少磁盘存储带来的节省进行对比。

arXiv:2608.19994v1 Announce Type: new 摘要:我们总结了在University of Manchester进行的两个暑期实习项目的成果,这些项目专注于基于机器学习的数据压缩算法在环境可持续性方面的收支平衡点。以基于机器学习的无损压缩算法为例,我们比较了机器学习训练和推理所需基础设施的碳当量估算与减少磁盘存储需求带来的碳当量节省,并讨论了其收支平衡点。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:31

# 基于机器学习的数据压缩的环境效益平衡点研究
来源:https://arxiv.org/html/2608.19994
## 绿色BOA:确定基于机器学习的数据压缩的环境效益平衡点
会议:第二届低碳计算国际研讨会;英国兰卡斯特;

Caterina Doglioni,Akshat Gupta 邮箱:[[email protected]](mailto:[email protected]) 所属机构:英国曼彻斯特大学,Manchester,UK,Thomas Elliott 邮箱:[[email protected]](mailto:[email protected]) 所属机构:英国曼彻斯特大学,Manchester,UK,Hanzila Hussain 邮箱:[[email protected]](mailto:[email protected]) 所属机构:英国曼彻斯特大学,Manchester,UK,Sanjiban Sengupta 邮箱:[[email protected]](mailto:[email protected]) 所属机构:CERN/英国曼彻斯特大学,Manchester,UK,以及 Zhengkai Sun 邮箱:[[email protected]](mailto:[email protected]) 所属机构:英国曼彻斯特大学,Manchester,UK

© 无

###### 摘要\.

我们总结了在曼彻斯特大学进行的两个暑期实习项目的结果,重点关注基于机器学习的数据压缩算法在环境可持续性方面的平衡点。以一个基于机器学习的无损压缩算法为例,我们比较了机器学习训练和推理所需基础设施的碳当量估算,与减少磁盘存储需求所节省的碳当量,并讨论了它们的平衡点。

背景。大数据实验,例如大型强子对撞机(2 (https://arxiv.org/html/2608.19994#bib.bib2))以及其他天体粒子物理实验(例如(13 (https://arxiv.org/html/2608.19994#bib.bib13))),将记录数艾字节的数据。这在预算(1 (https://arxiv.org/html/2608.19994#bib.bib1))和数据存储的环境资源方面(参见例如(15 (https://arxiv.org/html/2608.19994#bib.bib5); 11 (https://arxiv.org/html/2608.19994#bib.bib10)))都带来了巨大成本。数据压缩的研发工作正在进行中,其中包括基于机器学习(ML)的数据压缩。由于这类压缩技术通常比标准压缩算法(如 ZSTD(4 (https://arxiv.org/html/2608.19994#bib.bib11))和 LZMA(12 (https://arxiv.org/html/2608.19994#bib.bib12)))计算量更大,我们研究了训练和执行基于机器学习的压缩算法的二氧化碳当量成本,与存储压缩形式数据所替代的磁盘存储的隐含及运营二氧化碳当量之间的平衡点。

方法。我们考虑了曼彻斯特大学开发的一种基于机器学习的数据压缩算法(7 (https://arxiv.org/html/2608.19994#bib.bib3))的能耗,并估算其在 Nvidia T4 GPU 上进行机器学习训练和推理(压缩/解压往返)的能耗。我们考虑了多个执行这些步骤的国家/地区特定情景,根据平均能源结构将能耗转换为二氧化碳当量。

然后,我们考虑了制造和操作硬盘驱动器(HDD)和磁带形式的磁盘存储设备(生命周期为5年)的碳当量成本。作为示例,我们考虑了位于英国的 Seagate Exos X18 硬盘(14 (https://arxiv.org/html/2608.19994#bib.bib14))和磁带盒(10 (https://arxiv.org/html/2608.19994#bib.bib15))(遵循(11 (https://arxiv.org/html/2608.19994#bib.bib10); 16 (https://arxiv.org/html/2608.1994#bib.bib16))中的方法论)。

受(3 (https://arxiv.org/html/2608.19994#bib.bib6))启发,我们定义该项目的平衡点为:未压缩数据集的大小,使得训练和运行压缩算法的碳成本等于为存储未压缩数据而需要的额外磁盘存储的隐含碳成本。更多方法信息请参见附录。

这并非全面分析,而是一个概念验证计算,使用有限数据并基于若干假设。对于基于机器学习的数据压缩,仅考虑 CPU、GPU 和 RAM 的运营成本,因为我们假设 GPU 已经可用,并且其用于基于机器学习的数据压缩的消耗与大型强子对撞机实验中的其他用途相比可以忽略不计。所考虑的基于机器学习的数据压缩情景包括在完整数据集上进行训练,然后执行一次压缩和一次解压缩往返(在现有临时磁盘上)。未来工作将探索更广泛的情景。由于训练主导能耗,这可以被视为能耗的上限,因为在实践中,BOA 在(7 (https://arxiv.org/html/2608.19994#bib.bib3))中概述的泛化能力允许仅在小数据集上训练,然后将训练好的模型用于更大的数据集。

结果与结论。

如图1 (https://arxiv.org/html/2608.19994#S0.F1) 所示,平衡点的位置对执行基于机器学习的数据压缩的国家/地区的碳强度非常敏感。如先前文献所示,磁带存储的二氧化碳当量足迹低于硬盘驱动器,但代价是数据访问速度更慢。

参见标题 图1。基于机器学习的数据压缩及随后替代的硬盘/磁带存储的平衡分析结果(以二氧化碳当量计)。我们还将基于机器学习的数据压缩与标准算法进行了比较,同时考虑了性能(压缩比):由于 BOA 通常比标准算法(7 (https://arxiv.org/html/2608.19994#bib.bib3))获得更好的压缩比但吞吐量较低,因此其处理单位数据的二氧化碳强度高于非机器学习算法。虽然团队正在努力提高吞吐量,但仍然值得研究基于机器学习的方法的压缩增益是否值得在大规模部署中承担额外的环境成本。

## 附录:技术配置

以下,我们详细介绍了获得这些结果所使用的计算硬件和软件配置,以及硬盘和磁带二氧化碳当量估算的设置。

### 机器学习数据压缩

BOA 机器学习压缩算法在配备 Nvidia T4 GPU 运行时的 Google Colab 笔记本电脑上进行训练和执行。所选模型为两层 Mamba-v1 骨干网络,隐藏维度为64,字节词汇表大小为256,序列长度为10,000字节,批处理大小为5。训练以 FP32 精度进行八个周期,使用学习率 \(5\times 10^{-4}\) 和随机种子42。训练步骤包括八个训练周期、验证、最终测试评估和检查点写入。压缩步骤包括执行一次压缩和解压往返。被压缩的文件是来自(7 (https://arxiv.org/html/2608.19994#bib.bib3))的49.92 MB “bundled CMS 文件”(CMS_DATA_float32.bin),可在 BOA GitHub 仓库(8 (https://arxiv.org/html/2608.19994#bib.bib4))中找到;每条数据记录包含24个float32特征。在检查训练和推理碳成本的线性关系后,该文件的结果被缩放到图1 (https://arxiv.org/html/2608.19994#S0.F1) 中所示的最大数据集大小。

碳追踪使用 CodeCarbon(6 (https://arxiv.org/html/2608.19994#bib.bib7))进行,遵循(9 (https://arxiv.org/html/2608.19994#bib.bib9))中的教程。CodeCarbon 使用 `machine` 模式以一秒为间隔进行功耗采样,以测量基于机器学习的压缩训练和推理中使用的 CPU、GPU 和 RAM 的能耗。对于使用 ZSTD 和 LZMA 的压缩-解压往返,使用了相同的设置。我们知道 `machine` 模式测量的是 GPU、CPU 和 RAM 硬件堆栈的能耗(在使用 Google Colab 笔记本电脑时这些可能是共享的),但这是使用 CodeCarbon 获取 GPU 能耗估算的唯一方法。Intel® Xeon® CPU @ 2.00GHz 的热设计功耗(TDP)缩放用于 CPU 功耗(对应于8W),而 GPU 功耗则使用 `nvidia-ml-py` 包。

能耗与碳当量之间的转换使用 CodeCarbon 的国家能源结构平均情景(5 (https://arxiv.org/html/2608.19994#bib.bib8))进行。

### 存储服务器

碳成本包括隐含碳和运营碳(11 (https://arxiv.org/html/2608.19994#bib.bib10); 16 (https://arxiv.org/html/2608.19994#bib.bib16))。

对于在介质 \(m\) 上存储 \(D\) GB 数据 \(T\) 年,总存储碳成本为

\[
(1) \quad C_{m}(D,T) = C_{m,\mathrm{embodied}}(D) + C_{m,\mathrm{operational}}(D,T).
\]
对于硬盘存储,具有可用容量 \(K_{\mathrm{HDD}}\) 的驱动器是基本硬件单元。存储 \(D\) GB 所需的通电驱动器数量为

\[
(2) \quad N_{\mathrm{HDD}}(D) = \max\left(N_{\mathrm{HDD,min}}, \left\lceil\frac{D}{K_{\mathrm{HDD}}}\right\rceil\right),
\]
其中我们选择 \(N_{\mathrm{HDD,min}} = 1\),这意味着假设至少有一个驱动器保持安装和运行状态。鉴于本研究的范围和总数据量有限,硬盘的替代碳(未使用)按存储容量比例分配

\[
(3) \quad C_{\mathrm{HDD,non\text{-}use}}(D) = D \, e_{\mathrm{HDD,non\text{-}use}},
\]
其中 \(e_{\mathrm{HDD,non\text{-}use}}\) 是按容量分配的替代碳,单位为 \(\mathrm{gCO_2e/kWh}\)。运营碳使用通电驱动器的整数数量计算

\[
(4) \quad C_{\mathrm{HDD,operational}}(D,T) = N_{\mathrm{HDD}}(D) \frac{P_{\mathrm{HDD}}}{1000} (24)(365.25) \, T \, I_{\mathrm{HDD}} \, \mathrm{PUE},
\]
我们忽略电源使用效率(PUE)(并将其设置为1)。因此,总硬盘碳成本是这两个量的总和。硬盘情景使用 Seagate Exos X18 18 TB 驱动器。其标称容量和平均空闲功耗分别取为18 TB 和 5.3 W(14 (https://arxiv.org/html/2608.19994#bib.bib14))。替代的 \(\mathrm{kgCO_2e}\) 值取为每驱动器 27 \(\mathrm{kgCO_2e}\),对应的比例系数为 1.50 \(\mathrm{gCO_2e/GB}\)。

对于磁带存储,盒相关未使用碳使用 LTO-8 磁带盒的整数数量计算,而运营碳则按(11 (https://arxiv.org/html/2608.19994#bib.bib10))中完整的 RAL 磁带服务因子成比例计算。虽然这与硬盘的选择不一致,但此选择反映了现有数据的可用性。

类似于硬盘,磁带盒数量为

\[
(5) \quad N_{\mathrm{Tape}}(D) = \max\left(1, \left\lceil\frac{D}{K_{\mathrm{Tape}}}\right\rceil\right).
\]
总碳成本计算为

\[
(6) \quad C_{\mathrm{Tape}}(D,T) = N_{\mathrm{Tape}}(D) \, E_{\mathrm{Tape,non\text{-}use}}^{\mathrm{cartridge}} + \frac{D}{1000} \, T \, e_{\mathrm{Tape,RAL}},
\]
其中 \(E_{\mathrm{Tape,non\text{-}use}}^{\mathrm{cartridge}}\) 是一个磁带盒的非使用生命周期代理碳,单位为 \(\mathrm{gCO_2e/cartridge}\),\(e_{\mathrm{Tape,RAL}}\) 是完整的 RAL 磁带服务运营因子,单位为 \(\mathrm{gCO_2e/GByear}\)。第一项是磁带盒相关的替代(未使用)碳,第二项表示分配到存储数据量上的运营排放。模型使用了一个原生容量为12 TB的 LTO-8 磁带盒。相应的生命周期数据报告每个磁带盒的总值为 13.72 \(\mathrm{kgCO_2e}\),其中 5.70 \(\mathrm{kgCO_2e}\) 分配给运营阶段(10 (https://arxiv.org/html/2608.19994#bib.bib15); 11 (https://arxiv.org/html/2608.19994#bib.bib10))。

\[
(7) \quad E_{\mathrm{Tape,non\text{-}use}}^{\mathrm{cartridge}} = E_{\mathrm{Tape,total}}^{\mathrm{cartridge}} - E_{\mathrm{Tape,use}}^{\mathrm{cartridge}}.
\]
这里,\(E_{\mathrm{Tape,total}}^{\mathrm{cartridge}}\) 是报告的单个磁带盒的总生命周期碳排放,\(E_{\mathrm{Tape,use}}^{\mathrm{cartridge}}\) 是相应的使用阶段贡献。使用文献值 13.72 \(\mathrm{kgCO_2e/cartridge}\) 和 5.70 \(\mathrm{kgCO_2e/cartridge}\)(分别来自(10 (https://arxiv.org/html/2608.19994#bib.bib15); 11 (https://arxiv.org/html/2608.19994#bib.bib10))),得到

\[
(8) \quad E_{\mathrm{Tape,non\text{-}use}}^{\mathrm{cartridge}} = 13.72 - 5.70 = 8.02 \, \mathrm{kgCO_2e/cartridge}.
\]

###### 致谢\.

这项工作由 EPSRC 学生基金 EP/W524347/1(项目 2932638)通过 MADSIM CDT、曼彻斯特大学 Dame Kathleen Ollerenshaw 奖学金资助,并且是获得欧盟“地平线2020”研究与创新计划资助的项目的一部分(资助协议 101002463)。暑期学生资金也由 N8CIR 暑期实习计划提供。

## 参考文献

- \[1\]\(2022\) ATLAS软件与计算 HL-LHC 路线图。技术报告,CERN,Geneva。外部链接:[链接](https://cds.cern.ch/record/2802918) 被引用:绿色BOA:确定基于机器学习的数据压缩的环境效益平衡点 (https://arxiv.org/html/2608.19994#p1.1)。
- CERN (2017) CERN大型强子对撞机常见问题解答。技术报告,CERN,Geneva。外部链接:[链接](https://cds.cern.ch/record/2255762) 被引用:绿色BOA:确定基于机器学习的数据压缩的环境效益平衡点 (https://arxiv.org/html/2608.19994#p1.1)。
- Coignion 等人 (2025) T. Coignion, C. Quinton, 和 R. Rouvoy。当更快并不更环保:基于LLM的代码优化的隐藏成本。发表于 2025 第40届 IEEE/ACM 国际自动化软件工程会议 (ASE),第 1655–1666 页。外部链接:[链接](https://doi.org/10.1109/ASE63991.2025.00139),[文档](https://dx.doi.org/10.1109/ASE63991.2025.00139) 被引用:绿色BOA:确定基于机器学习的数据压缩的环境效益平衡点 (https://arxiv.org/html/2608.19994#p4.1)。
- Collet 和 Kucherawy (2021) Y. Collet 和 M. Kucherawy。Zstandard压缩与‘application/zstd’媒体类型。RFC 技术报告 8878,IETF。外部链接:[文档](https://dx.doi.org/10.17487/RFC8878),[链接](https://www.rfc-editor.org/info/rfc8878) 被引用:绿色BOA:确定基于机器学习的数据压缩的环境效益平衡点 (https://arxiv.org/html/2608.19994#p1.1)。
- Courty 等人 (2023) B. Courty 等人。私有基础设施的全球电力碳强度数据。注:CodeCarbon源仓库中的数据文件,区域情景使用了国家级别平均因子;访问日期:2026年8月5日。外部链接:[链接](https://github.com/mlco2/codecarbon/blob/master/codecarbon/data/private_infra/global_energy_mix.json) 被引用:机器学习数据压缩 (https://arxiv.org/html/2608.19994#Sx1.SSx1.p3.1)。
- Courty 等人 (2026) Mlco2/codecarbon: v3.3.0。外部链接:[文档

相似文章

我们可以用SLMs压缩数据吗?

Reddit r/LocalLLaMA

探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。