@svpino: 无服务器,但针对模型的,来了!我在12年前就不再租用服务器了。我基本上把所有东西都迁移到了无服务器函数上……
摘要
Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。
查看缓存全文
缓存时间: 2026/07/21 06:41
无服务器,但这次是对模型而言的!
我12年前就不再租用服务器了。大部分工作都迁移到了无服务器函数上。
这个想法在AI模型上实现花了很长时间。
问题很简单:你可以在毫秒内启动一个简单的函数,并将其缩放到零以节省成本,但将20GB的模型加载到内存中需要相当长的时间。
而且一旦模型加载完毕,就别想关闭它了。你最好为闲置的GPU付费,而不是强迫下一个用户等待所有内容重新加载。
所以你有两个选择:
- 优化低延迟响应,为闲置GPU付费,或
- 优化低成本,缩放到零,让用户等待
两者都不好,幸运的是,我们不再需要选择了。
Runpod,这个新兴的AI开发者云,用一种非常巧妙的方式解决了这个问题:
• 它们不会关闭闲置的模型 • 而是将其移动到更便宜的地方 • 当流量恢复时,再将模型调回GPU
整个过程极快:对于繁忙的端点,冷启动时间低于200毫秒。它们将此技术称为“FlashBoot“。
除此之外,为了部署你的模型,它们抛弃了Docker,因为不想让你每次修改一行代码就花时间重建一个庞大的镜像。取而代之的是,你得到一个Python函数,附带一行指定所需GPU的代码。你可以借此在几秒内部署。
第一次运行总是最慢的,因为你要安装依赖,但之后,你就可以非常快速地运行非常大的模型了。
总结:
- 针对模型的无服务器时代已经到来
- 你不需要更强大的GPU
- 实际成本比大型云服务商提供的90%的方案要便宜90%
相似文章
如何实现真正的无服务器GPU(20分钟阅读)
Modal介绍了他们开发的四个关键要素,可在几秒而非几分钟内启动无服务器GPU推理副本,从而实现对多变AI工作负载的高效GPU分配。
@charles_irl: 实现真正无服务器GPU用于AI推理的第二步:跳过容器启动时的完整镜像加载。相反,异步加载镜像…
讨论了一种通过跳过容器启动时的完整镜像加载而异步加载镜像来实现真正无服务器GPU用于AI推理的技术。
@chiefofautism: 拿一个中文模型,用企业数据集微调,然后放到Runpod serverless上
一条推文讨论了在中文模型上使用企业数据进行微调,并将其部署到Runpod serverless,作为昂贵API调用的经济高效的替代方案。
@akshay_pachaar: 无服务器 vs 本地部署 vs 边缘部署。(下次部署前必读)这三种方式是对同一个问题……
本文比较了无服务器、本地和边缘部署三种 AI 模型部署方式,指出了当前多模型服务中的低效问题。它介绍了 Superlinked Inference Engine (SIE),一个开源工具,通过动态加载和卸载权重,在单个 GPU 上服务多个模型,旨在降低成本和复杂性。
@charles_irl: 推理并非一切,但它确实需要一个新的技术栈——不是 Kubernetes,也不是 SLURM。在 @modal,我们深入探索构建…
Modal 工程师详细介绍了他们实现真正无服务器 GPU 用于 AI 推理的方法,结合了云缓冲区、自定义内容寻址文件系统以及 CPU/GPU 检查点/恢复,从而在几十秒内(而不是几分钟)扩展副本。