@akshay_pachaar: Redis 构建了一个缓存,将 LLM 成本削减了 70%!生产环境中的 LLM 应用程序经常接收相同问题的不同版本…

X AI KOLs Timeline 工具

摘要

Redis LangCache 是一种语义缓存工具,通过存储和重用类似的问题-响应对,将 LLM 成本降低高达 70%,使 AI 应用程序更快、更具成本效益。

Redis 构建了一个缓存,将 LLM 成本削减了 70%! 生产环境中的 LLM 应用程序经常接收相同问题的不同版本。 例如,一个内部开发者助手可能会收到: - "如何轮换 API 密钥?" - "在哪里可以更换我的 API 密钥?" 措辞不同,但两个问题的答案相同。 前缀缓存无法处理这种重复生成,因为它只在缓存逐位匹配时才重用计算。 即使缓存命中,LLM 响应仍然会被再次生成。 语义缓存在模型外部存储完整的问题-响应对。 当查询到达时,它搜索具有相似含义的已回答问题。有效的匹配会返回存储的响应,无需 LLM 调用。 如果你想在实践中使用它,@Redisinc 已经将其作为名为 Redis LangCache 的托管服务实现。 在底层,LangCache 嵌入传入的问题,搜索存储的响应,并应用配置的相似度阈值和过滤器。 缓存命中返回早期的响应。缓存未命中则回退到 LLM,之后可以将新响应存储以供将来请求使用。 Redis 还通过 REST API 处理访问范围、自定义过滤器、嵌入选择、TTL、驱逐和监控,无需部署或管理另一个数据库。 虽然实际节省取决于工作负载中存在多少安全重复,但缓存命中的响应速度提高多达 15 倍,成本降低 70%。 尝试 Redis LangCache:https://fandf.co/4d3ixqL 我构建了一个小型界面,比较 LangCache 与直接 LLM 推理。下面的视频展示了实际操作,我与 Redis 合作完成了这篇帖子。 要深入了解,我的联合创始人在 KV、前缀、提示和语义缓存方面发表了一篇详细文章。 请阅读下文。
查看原文
查看缓存全文

缓存时间: 2026/09/23 22:16

Redis构建了一个缓存系统,可将大语言模型成本降低70%!

生产环境中的大语言模型应用常常会收到同一问题的不同表述版本。

例如,内部开发者助手可能收到以下提问:

  • “如何轮换API密钥?”
  • “在哪里可以更换我的API密钥?”

虽然措辞不同,但两个问题的答案完全相同。

前缀缓存无法处理这种重复生成场景,因为它仅在缓存逐位匹配时才能重用计算结果。

即使缓存命中,大语言模型仍需重新生成响应。

语义缓存将完整的问题-响应对存储在模型外部。

当新查询到达时,系统会搜索语义相近的历史问答。有效匹配将直接返回存储的响应,无需调用大语言模型。

如果你想在实际中应用此技术,@Redisinc 已将其作为托管服务 Redis LangCache 实现。

在底层,LangCache会对输入问题进行向量化处理,搜索已存储的响应,并应用配置的相似度阈值与过滤器。

缓存命中时直接返回历史响应;未命中时回退至大语言模型处理,新响应可存储供后续请求使用。

Redis还通过REST API提供访问范围控制、自定义过滤器、向量化方案选择、TTL设置、数据淘汰策略及监控功能,无需额外部署或管理数据库。

虽然实际节省效果取决于工作负载中安全的重复程度,但缓存命中的响应速度最高可提升15倍,成本降低70%。

体验Redis LangCache:https://fandf.co/4d3ixqL

我构建了一个对比LangCache与直接大语言模型推理的小型演示界面。下方视频展示了实际效果,本文是与Redis合作完成的成果。

如需深入了解,我的联合创始人在KV、前缀、提示词与语义缓存方面发表了详细解析文章。

请继续阅读下文。


Redis LangCache

来源:https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x 平台(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)部署(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)工具

  • Redis Insight可视化、查询与调试界面(https://redis.io/insight/)
  • RIOT从任意数据源导入Redis(https://redis.io/docs/latest/integrate/riot/)
  • 客户端库Python、Node、Java、Go、.Net等(https://redis.io/docs/latest/develop/clients/)
  • SDK集成Redis至应用程序(https://redis.io/docs/latest/integrate/)

解决方案(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)人工智能与机器学习应用

  • 扩展智能体与智能系统全方位成功要素(https://redis.io/docs/latest/develop/ai/)
  • 检索增强生成理解Redis如何赋能RAG(https://redis.io/docs/latest/develop/get-started/rag/)
  • 语义搜索即时获取精准答案(https://redis.io/query-engine/)
  • 机器学习快速运用特征工程(https://redis.io/docs/latest/develop/ai/featureform/)
  • 令牌优化以更低成本实现AI全功能(https://redis.io/langcache/)

核心业务场景

  • 欺诈检测遏制欺诈保护客户(https://redis.io/blog/a-complete-guide-to-ai-fraud-detection/)
  • 实时决策基于数据实时行动(https://redis.io/solutions/real-time-decisioning/)
  • 缓存与性能我们的核心专长(https://redis.io/solutions/caching/)
  • 实时消息流思维速度的消息传递(https://redis.io/solutions/messaging/)
  • 会话管理全域一致体验(https://redis.io/solutions/session-store/)
  • 排行榜掌握竞争态势(https://redis.io/solutions/leaderboards/)

开发者(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)学习资源

  • 博客全部技术文章(https://redis.io/blog/)
  • 资源中心一站式资源库(https://redis.io/resources/)
  • 演示中心全场景实战演示(https://redis.io/demo-center/)
  • 参考架构直接部署无需摸索(https://redis.io/resources/architecture-diagrams/)

资源(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)

Ulta标志

通过Redis赋能的在线体验实现40%收入增长了解详情

Superlinked标志

基于Redis处理每秒100+向量搜索查询了解详情

Sony LIV标志

API响应速度提升37%,内存占用降低15%了解详情

plivo标志

通过Redis处理超十亿月度API请求了解详情

最新动态

图片

办公时间:为何你的智能体总是偏离主题

2026年9月9日

相似文章