GPUHedge:在无服务器GPU提供商之间进行对冲可将冷启动p95延迟从117秒降低到30秒 [P]

Reddit r/MachineLearning 工具

摘要

GPUHedge是一个开源工具,它使用投机执行在无服务器GPU提供商之间进行对冲,将冷启动p95延迟从117秒降低到30秒。

声明:这是我开发的,它是开源的,采用Apache-2.0许可证,目前处于alpha阶段。仓库:https://github.com/mireklzicar/gpuhedge 我在对17GB的AI模型在多个无服务器GPU提供商上进行基准测试后开始研究它。在主要提供商上,请求通常在大约6-8秒内完成,或者在新GPU冷启动后大约需要90-122秒。仅仅切换到另一个提供商并不能消除问题,因为每个提供商都有自己的尾部延迟。GPUHedge将此视为投机执行问题。它在主要提供商上启动一个请求,监控作业的生命周期状态,并有条件地启动或切换到备用提供商。第一个通过验证器的结果获胜,失败的任务通过提供商的本地API取消。无需创建提供商账户或花钱即可尝试策略引擎:pip install gpuhedge 在初始基准测试中,固定设置RunPod → Cerebrium对冲在10秒后启动。在36个请求的评估部分,结果改变了:观察到的p95延迟从116.6秒降至29.4秒;超过60秒的请求从11/36降至0/36;建模的活动计算成本从每请求0.0114美元降至0.0083美元。你对冷启动延迟有什么经验?接下来添加哪个提供商?像这样的工具能帮助你正在构建的东西吗?
查看原文

相似文章

利用 GPU 快照减少 GVisor 冷启动

Hacker News Top

Cerebrium 通过检查点 CPU 和 GPU 内存,减少 AI 工作负载的 GPU 冷启动,在数秒内恢复完全初始化的容器,将启动时间缩短超过 80%。