@svpino: 无服务器,但针对模型的,来了!我在12年前就不再租用服务器了。我基本上把所有东西都迁移到了无服务器函数上……

X AI KOLs Timeline 产品

摘要

Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。

无服务器,但针对模型的,来了! 我在12年前就不再租用服务器了。我基本上把所有东西都迁移到了无服务器函数上。 这个想法要在 AI 模型上实现,花了不少时间。 问题很简单:启动一个简单的函数可以毫秒级完成,并且可以缩到零免费,但加载一个 20GB 的模型到内存中需要不少时间。 而且一旦模型加载完毕,就别想着关闭它了。你最好为闲置的 GPU 付费,而不是让下一个用户等待所有内容重新加载。 所以你有两个选择: 1. 为低延迟响应优化,为闲置 GPU 付费,或 2. 为降低成本优化,缩到零让用户等待 两者都不好,幸运的是,我们不再需要选择了。 新的 AI 开发者云 Runpod 正在用非常聪明的方法解决这个问题: • 他们不会关闭空闲模型 • 而是将它们移动到更便宜的地方 • 当流量回来时,将模型页面调回 GPU 整个过程非常快:繁忙端点的冷启动时间低于 200 毫秒。他们称这种技术为“FlashBoot”。 除此之外,为了让您部署模型,他们抛弃了 Docker,因为他们不希望您每次更改一行代码就花时间重建一个巨大的镜像。取而代之的是,您得到一个 Python 函数,附带一行指定所需 GPU 的代码。您可以在几秒内部署。 第一次运行总是最慢的,因为要安装依赖,但之后,您可以非常快速地运行非常大的模型。 总结: 1. 无服务器现已针对模型可用 2. 您不需要更好的 GPU 3. 实际比大型云服务提供的 90% 便宜 90%
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:41

无服务器,但这次是对模型而言的!

我12年前就不再租用服务器了。大部分工作都迁移到了无服务器函数上。

这个想法在AI模型上实现花了很长时间。

问题很简单:你可以在毫秒内启动一个简单的函数,并将其缩放到零以节省成本,但将20GB的模型加载到内存中需要相当长的时间。

而且一旦模型加载完毕,就别想关闭它了。你最好为闲置的GPU付费,而不是强迫下一个用户等待所有内容重新加载。

所以你有两个选择:

  1. 优化低延迟响应,为闲置GPU付费,或
  2. 优化低成本,缩放到零,让用户等待

两者都不好,幸运的是,我们不再需要选择了。

Runpod,这个新兴的AI开发者云,用一种非常巧妙的方式解决了这个问题:

• 它们不会关闭闲置的模型 • 而是将其移动到更便宜的地方 • 当流量恢复时,再将模型调回GPU

整个过程极快:对于繁忙的端点,冷启动时间低于200毫秒。它们将此技术称为“FlashBoot“。

除此之外,为了部署你的模型,它们抛弃了Docker,因为不想让你每次修改一行代码就花时间重建一个庞大的镜像。取而代之的是,你得到一个Python函数,附带一行指定所需GPU的代码。你可以借此在几秒内部署。

第一次运行总是最慢的,因为你要安装依赖,但之后,你就可以非常快速地运行非常大的模型了。

总结:

  1. 针对模型的无服务器时代已经到来
  2. 你不需要更强大的GPU
  3. 实际成本比大型云服务商提供的90%的方案要便宜90%

相似文章