标签
本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。
2026年低资源计算研讨会挑战计算无限增长的趋势,倡导以历史成就为灵感的资源高效计算,旨在将处理能力重新交到个人手中,实现可持续的未来。
本综述全面回顾了面向绿色AI的资源高效架构与软硬件协同设计,涵盖高效模型构建、训练/部署策略以及可持续硬件,旨在指导大模型的可持续发展。