@akshay_pachaar:重大突破!自托管LLM的成本刚刚降低了约75%:大多数Agent流水线现在在底层运行4-5个小模型……

X AI KOLs Timeline 工具

摘要

Superlinked发布了SIE,一个开源推理引擎,通过一个API提供85+个模型,支持按需加载和LRU逐出,为Agent流水线节省约75%的自托管GPU成本。

重大突破! 自托管LLM的成本刚刚降低了约75%: 大多数Agent流水线现在在底层运行4-5个小模型:用于检索的嵌入器、用于精确度的重排序器、用于实体提取的提取器,以及通常还有一个用于常规生成的小型LLM。 标准的服务方式是为每个模型运行一个服务器。vLLM托管LLM,TEI托管嵌入器,其他所有东西都用一个自定义的FastAPI包装器。 每个服务器都会预留自己的GPU内存切片,无论是否有流量都会占用。GPU按小时计费,所以空闲时间和繁忙时间成本相同。 这就是为什么切换到小模型很少能降低账单。成本从来不在调用上,而是在服务器上。 结构性的解决方案是从一个进程中服务所有模型,根据流量加载和驱逐模型。 Superlinked刚刚开源了这个方案。SIE(Superlinked推理引擎)是一个Apache 2.0服务器,在一个API后面运行85+个模型。 四个调用覆盖整个流水线: - encode() 返回向量 - score() 返回相关性分数 - extract() 返回实体片段 - generate() 运行小型开放LLM。 模型在首次请求时加载,并按最近最少使用(LRU)策略驱逐,因此一个GPU可以服务一组轮换的模型,而不是被孤立地只服务于单一模型。 它可以在从笔记本电脑到Kubernetes集群的任何地方运行,并且可以接入Qdrant、Weaviate、Chroma、LanceDB、LangChain和LlamaIndex。 你可以在这里找到仓库:https://github.com/superlinked/sie (别忘了点星标) 我还写了一篇SIE的实操指南。文章通过一个真实示例,展示了如何在单个GPU上部署和管理五个模型,包括一个小型语言模型、一个OCR模型、一个NER模型、一个重排序器和一个目标检测器。 文章引用如下。
查看原文
查看缓存全文

缓存时间: 2026/08/06 08:35

SIE:Superlinked 推理引擎

面向智能体的自托管推理。你的智能体调用的每个开放模型,都由你云中的一个集群提供服务。

文档 | 快速开始 | API 参考 | 模型

superlinked.com/docs | Apache 2.0

相似文章

我们构建了一个源码可用的LLM可靠性库(对研究/个人/内部评估免费),可在保持同等质量的前提下将推理成本降低一半,只需更改一个import语句即可采用 [P] [R]

Reddit r/MachineLearning

AgentCodec 是一个源代码可用的库,它将 28 种 LLM 可靠性技术(如重试、集成、生成器/判别器优化等)统一到单一兼容 OpenAI 的 API 下,并配备自适应路由器,在匹配质量的情况下可降低约 56% 的推理成本。该库采用通信理论框架,支持即插即用替代 OpenAI、Anthropic 和 Ollama 客户端。