@yoheinakajima: Netflix的技术栈
摘要
Netflix使用vLLM和NVIDIA Triton构建了一个内部LLM服务平台,通过统一的gRPC和兼容OpenAI的API将自托管模型集成到生产基础设施中,并分享了生产经验。
查看缓存全文
缓存时间: 2026/07/28 10:30
Netflix 的技术栈
Python Hub (@PythonHub): Netflix 内部 LLM 服务
Netflix 使用 vLLM 和 NVIDIA Triton 构建了一个内部 LLM 服务平台,通过统一的 gRPC 和兼容 OpenAI 的 API,将自托管模型集成到其现有生产基础设施中。文章详细介绍了生产过程中的经验教训
相似文章
@keigohtr: 来自Netflix。他们的内部LLM服务方法。In-House LLM Serving at Netflix https://netflixtechblog.com/in-house-l…
Netflix分享了他们的内部LLM服务方法,使用vLLM和Triton推理服务器,提供兼容OpenAI的API,并详细介绍了部署策略和生产权衡。
Netflix 如何构建其 LLM 服务栈(18 分钟阅读)
Netflix 分享了其内部 LLM 服务栈背后的设计决策,包括引擎选择(vLLM)、模型打包、API 接口和部署策略,重点介绍了在生产负载下揭示的权衡取舍。
@tonysimons_: 一位Netflix工程师构建了一个开源代理,可将AI token使用量减少60-95%。零代码更改。基准测试显示±0…
一位Netflix工程师构建了Headroom,这是一个开源代理,可在无需代码更改且精度损失可忽略的情况下,将LLM上下文压缩60-95%。它支持主要AI代理,并在GitHub上以Apache 2.0许可提供。
@llmgateway: https://x.com/llmgateway/status/2090875947285393595
TanStack AI 发布了一款官方 LLM Gateway 适配器,使开发者能够使用单个 API 密钥访问来自 40 多家提供商的 200 多个 AI 模型,并支持单行代码切换模型。
@rohanpaul_ai: Netflix 揭示了那些短小的“因为你看过”提示背后的系统:一个 AI 编写它们,另一个 AI 评分它们…
Netflix 在一篇新论文中详细介绍了他们如何使用 AI 撰写推荐解释,并用另一个 AI 进行评分,强调了生产环境中评分模型的生命周期和维护。