DumpsterCluster:从捡垃圾到用60美元GPU服务LLaMA-70B
摘要
本文探讨使用退役GPU构建低成本集群以服务LLaMA-70B,发现在电力廉价地区具有经济可行性,但也指出在没有清洁能源来源的情况下可能导致高碳排放。
查看缓存全文
缓存时间: 2026/08/18 07:51
论文页面 - DumpsterCluster:从废旧硬件到用60美元GPU运行LLaMA-70B
来源:https://huggingface.co/papers/2608.14614
发布于 7月10日
·
由 https://huggingface.co/iliashum 提交
i (https://huggingface.co/iliashum) 于 8月18日
摘要
退役GPU可组建低成本集群用于大语言模型推理,但其经济与环境可行性高度依赖当地电价和碳排放强度。
随着AI数据中心淘汰仍可运行的GPU,大量功能尚存的加速卡流入二手市场。本研究探讨这些退役GPU能否获得“新生”,构建一个DumpsterCluster (https://huggingface.co/papers?q=DumpsterCluster)来支持现代大语言模型推理,并分析这种再利用在何种条件下具备经济可行性和环境可持续性。我们使用二手组件从零搭建了128块GPU的DumpsterCluster (https://huggingface.co/papers?q=DumpsterCluster)并运行一年。按当前市场价格(该DumpsterCluster (https://huggingface.co/papers?q=DumpsterCluster)成本约2.2万美元,而8块B200系统需60万美元),经济优势显著。通过流水线并行优化 (https://huggingface.co/papers?q=pipeline-parallel%20optimizations),基于V100的DumpsterCluster (https://huggingface.co/papers?q=DumpsterCluster)实现了有竞争力的LLaMA-70B (https://huggingface.co/papers?q=LLaMA-70B)吞吐量,验证了生产可行性。然而,部署揭示了关键的情境依赖性:旧GPU每token能耗显著更高,仅在电价低廉地区总拥有成本 (https://huggingface.co/papers?q=total%20cost%20of%20ownership)才具备优势。在电网平均碳排放强度 (https://huggingface.co/papers?q=carbon%20intensity)下,二手系统对于8B模型的每token总碳排放量约为当前硬件的4倍,对于70B模型则超过40倍。这表明GPU的二次利用并非普遍可持续——硬件再利用必须战略性地与低碳能源结合。当部署于能源经济性良好且使用清洁电力的地区时,二手GPU (https://huggingface.co/papers?q=second-hand%20GPUs)为扩展AI算力、提升可负担性、保障能源安全及履行环境责任提供了可行路径。
查看arXiv页面 (https://arxiv.org/abs/2608.14614) | 查看PDF (https://arxiv.org/pdf/2608.14614) | 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.14614)
通过工具获取本论文:
hf papers read 2608.14614
尚未安装最新CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型
无模型关联此论文
在模型README.md中引用 arxiv.org/abs/2608.14614 即可从本页链接。
引用本论文的数据集
无数据集关联此论文
在数据集README.md中引用 arxiv.org/abs/2608.14614 即可从本页链接。
引用本论文的Space
无Space关联此论文
在Space的README.md中引用 arxiv.org/abs/2608.14614 即可从本页链接。
包含本论文的集合
无集合收录本论文
将本论文添加至集合 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
对15款“电子垃圾”GPU进行现代工作负载基准测试
对15款退役的NVIDIA Tesla GPU(K80、P100、V100)进行现代AI工作负载基准测试,展示它们在家庭实验室推理设置中的可行性和性价比。
没人知道二手GPU集群值多少钱
关于将二手GPU集群作为债务融资抵押品时估值挑战的分析,强调了运营依赖性和硬件故障率使得传统资产评估无法进行。
@analogalok: 买不起2000美元的GPU这个借口已经彻底失效了。昨天我展示了如何解锁一块企业级16GB……
关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。
我对15款"E-Waste"GPU进行了现代工作负载基准测试
对15款被视为电子垃圾的老款GPU进行基准测试比较,测试它们在现代工作负载下的性能。
针对短时LLM运行的云GPU存储费用高昂。你的工作流程是怎样的?
用户寻求针对短时LLM测试会话的成本效益云GPU工作流程建议,强调在运行之间保留环境时存储费用是主要痛点。