标签
本文复现了一项关于使用FLOPs评估AI效率的研究,验证了原始FLOPs在新硬件上不适合作为执行时间的度量,并强调了研究中完整复现包的必要性。
一项系统性综述和实证研究,比较了深度学习模型的碳足迹,考察了绿色AI技术和测量工具,发现训练阶段是排放的主要来源,且更大的架构并不总能带来成比例的精度提升。
本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。
本综述全面回顾了面向绿色AI的资源高效架构与软硬件协同设计,涵盖高效模型构建、训练/部署策略以及可持续硬件,旨在指导大模型的可持续发展。
本文提出A-LEMS框架,将AI能量核算从每次推理重新定义为每个成功目标(EpG),并引入编排开销指数(OOI)来衡量自主系统中多步编排的能量成本。实证结果表明,自主工作流每个目标的平均能耗比线性基线高4.33倍,但OOI在工具增强型任务中可能反转,证明目标级核算是必要的。
本文提出了一种针对大语言模型蒸馏管道的端到端能耗核算框架,通过分阶段测量能耗并构建能耗-质量帕累托前沿,揭示了此前被忽视的教师模型侧成本。