GPUHedge:在无服务器GPU提供商之间进行对冲可将冷启动p95延迟从117秒降低到30秒 [P]
摘要
GPUHedge是一个开源工具,它使用投机执行在无服务器GPU提供商之间进行对冲,将冷启动p95延迟从117秒降低到30秒。
声明:这是我开发的,它是开源的,采用Apache-2.0许可证,目前处于alpha阶段。仓库:https://github.com/mireklzicar/gpuhedge 我在对17GB的AI模型在多个无服务器GPU提供商上进行基准测试后开始研究它。在主要提供商上,请求通常在大约6-8秒内完成,或者在新GPU冷启动后大约需要90-122秒。仅仅切换到另一个提供商并不能消除问题,因为每个提供商都有自己的尾部延迟。GPUHedge将此视为投机执行问题。它在主要提供商上启动一个请求,监控作业的生命周期状态,并有条件地启动或切换到备用提供商。第一个通过验证器的结果获胜,失败的任务通过提供商的本地API取消。无需创建提供商账户或花钱即可尝试策略引擎:pip install gpuhedge 在初始基准测试中,固定设置RunPod → Cerebrium对冲在10秒后启动。在36个请求的评估部分,结果改变了:观察到的p95延迟从116.6秒降至29.4秒;超过60秒的请求从11/36降至0/36;建模的活动计算成本从每请求0.0114美元降至0.0083美元。你对冷启动延迟有什么经验?接下来添加哪个提供商?像这样的工具能帮助你正在构建的东西吗?
相似文章
如何实现真正的无服务器GPU(20分钟阅读)
Modal介绍了他们开发的四个关键要素,可在几秒而非几分钟内启动无服务器GPU推理副本,从而实现对多变AI工作负载的高效GPU分配。
Launch HN: Expanse (YC P26) – 解锁闲置的GPU算力
Expanse 是一家创业公司,通过预测作业资源需求并提供优化建议,提高GPU/HPC集群的利用率,解决常见的过度请求资源导致实际利用率仅为30-40%的问题。
利用 GPU 快照减少 GVisor 冷启动
Cerebrium 通过检查点 CPU 和 GPU 内存,减少 AI 工作负载的 GPU 冷启动,在数秒内恢复完全初始化的容器,将启动时间缩短超过 80%。
@svpino: 无服务器,但针对模型的,来了!我在12年前就不再租用服务器了。我基本上把所有东西都迁移到了无服务器函数上……
Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。
2026年GPU访问依然糟糕——有人正试图用计算期货市场来修复
Inferra正在构建一个GPU计算衍生品交易所,为H100、B200等芯片提供永续期货,实现价格发现和成本对冲,旨在解决不透明的GPU市场。