@akshay_pachaar: 无服务器 vs 本地部署 vs 边缘部署。(下次部署前必读)这三种方式是对同一个问题……

X AI KOLs Following 工具

摘要

本文比较了无服务器、本地和边缘部署三种 AI 模型部署方式,指出了当前多模型服务中的低效问题。它介绍了 Superlinked Inference Engine (SIE),一个开源工具,通过动态加载和卸载权重,在单个 GPU 上服务多个模型,旨在降低成本和复杂性。

无服务器 vs 本地部署 vs 边缘部署。 (下次部署前必读) 这三种方式是对同一个问题(你的模型实际在哪里运行)的不同回答,每种方式的成本各不相同。 1) 无服务器意味着你将模型交给提供商,提供商仅在请求到达时启动机器。请求之间容器关闭,闲置时不付费。权重也随之卸载,因此下一次调用需要重新将 GB 级数据加载到内存中才能响应,耗时可达 90 秒。一个位于搜索流程中间的排序器不能花这么长时间唤醒,因此你会保持实例热状态,结果又回到了闲置 GPU 付费的局面。 2) 本地部署意味着你自己租用或拥有 GPU,并在自己的网络内运行服务器。数据不会离开你的内部环境,没有冷启动,因为引擎已经持有权重,而且你支付的是固定小时费率,而非按 token 计费。无论是否有流量,显卡都在运行。 3) 边缘部署意味着模型在用户自己的设备上运行,在其 NPU 或 CPU 上,通过一个小型本地运行时。模型必须缩小以适应,因此可以离线工作,数据永远不会离开硬件,但它只处理一个狭窄的任务,而非完整的流水线。 本地部署是认真团队的最终选择,而且只有多个模型共享一张显卡时才划算。 但这种情况很少发生,因为 vLLM 在启动时会预分配 90% 的 GPU 内存,并忽略同一 GPU 上的其他 vLLM 实例,而 HuggingFace TEI(文本嵌入推理)每个进程只处理一个模型 ID。两者都不知道对方的存在。 因此四个小模型最终会占用四张不同的显卡。你切换成小模型本是为了减少开销,现在却需要租用四个 GPU 来运行本应一张就能承载的内容。 中间那一排的服务引擎决定了本地部署是便宜还是只是换了一种贵法。 显卡从来不是瓶颈。缺失的是一台能容纳所有模型、并根据流量移动内存的服务器,而不是四台各自以为独占整张 GPU 的服务器。 Superlinked Inference Engine (SIE) 正是为此而构建的开源项目。一个服务器处理嵌入、排序、提取和生成,在首次请求需要时加载模型,并在内存不足时丢弃最近最少使用的模型。 在 GitHub 上查看:http://github.com/superlinked/sie (别忘了点星) 我的联合创始人写了一篇详细的介绍,说明 SIE 是什么以及如何开始使用。 以下引用文章内容。
查看原文
查看缓存全文

缓存时间: 2026/07/28 08:28

SIE:Superlinked 推理引擎

面向智能体的自托管推理。您的智能体调用的每一个开放模型,都通过您云中的一个集群提供服务。

文档 | 快速开始 | API 参考 | 模型

superlinked.com/docs | Apache 2.0

相似文章

使用云托管GPU运行AI

Reddit r/openclaw

关于使用云托管GPU运行AI模型的文章,涵盖部署选项和注意事项。