@akshay_pachaar: Redis 构建了一个缓存,将 LLM 成本削减了 70%!生产环境中的 LLM 应用程序经常接收相同问题的不同版本…
摘要
Redis LangCache 是一种语义缓存工具,通过存储和重用类似的问题-响应对,将 LLM 成本降低高达 70%,使 AI 应用程序更快、更具成本效益。
查看缓存全文
缓存时间: 2026/09/23 22:16
Redis构建了一个缓存系统,可将大语言模型成本降低70%!
生产环境中的大语言模型应用常常会收到同一问题的不同表述版本。
例如,内部开发者助手可能收到以下提问:
- “如何轮换API密钥?”
- “在哪里可以更换我的API密钥?”
虽然措辞不同,但两个问题的答案完全相同。
前缀缓存无法处理这种重复生成场景,因为它仅在缓存逐位匹配时才能重用计算结果。
即使缓存命中,大语言模型仍需重新生成响应。
语义缓存将完整的问题-响应对存储在模型外部。
当新查询到达时,系统会搜索语义相近的历史问答。有效匹配将直接返回存储的响应,无需调用大语言模型。
如果你想在实际中应用此技术,@Redisinc 已将其作为托管服务 Redis LangCache 实现。
在底层,LangCache会对输入问题进行向量化处理,搜索已存储的响应,并应用配置的相似度阈值与过滤器。
缓存命中时直接返回历史响应;未命中时回退至大语言模型处理,新响应可存储供后续请求使用。
Redis还通过REST API提供访问范围控制、自定义过滤器、向量化方案选择、TTL设置、数据淘汰策略及监控功能,无需额外部署或管理数据库。
虽然实际节省效果取决于工作负载中安全的重复程度,但缓存命中的响应速度最高可提升15倍,成本降低70%。
体验Redis LangCache:https://fandf.co/4d3ixqL
我构建了一个对比LangCache与直接大语言模型推理的小型演示界面。下方视频展示了实际效果,本文是与Redis合作完成的成果。
如需深入了解,我的联合创始人在KV、前缀、提示词与语义缓存方面发表了详细解析文章。
请继续阅读下文。
Redis LangCache
来源:https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x 平台(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)部署(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)工具
- Redis Insight可视化、查询与调试界面(https://redis.io/insight/)
- RIOT从任意数据源导入Redis(https://redis.io/docs/latest/integrate/riot/)
- 客户端库Python、Node、Java、Go、.Net等(https://redis.io/docs/latest/develop/clients/)
- SDK集成Redis至应用程序(https://redis.io/docs/latest/integrate/)
解决方案(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)人工智能与机器学习应用
- 扩展智能体与智能系统全方位成功要素(https://redis.io/docs/latest/develop/ai/)
- 检索增强生成理解Redis如何赋能RAG(https://redis.io/docs/latest/develop/get-started/rag/)
- 语义搜索即时获取精准答案(https://redis.io/query-engine/)
- 机器学习快速运用特征工程(https://redis.io/docs/latest/develop/ai/featureform/)
- 令牌优化以更低成本实现AI全功能(https://redis.io/langcache/)
核心业务场景
- 欺诈检测遏制欺诈保护客户(https://redis.io/blog/a-complete-guide-to-ai-fraud-detection/)
- 实时决策基于数据实时行动(https://redis.io/solutions/real-time-decisioning/)
- 缓存与性能我们的核心专长(https://redis.io/solutions/caching/)
- 实时消息流思维速度的消息传递(https://redis.io/solutions/messaging/)
- 会话管理全域一致体验(https://redis.io/solutions/session-store/)
- 排行榜掌握竞争态势(https://redis.io/solutions/leaderboards/)
开发者(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)学习资源
- 博客全部技术文章(https://redis.io/blog/)
- 资源中心一站式资源库(https://redis.io/resources/)
- 演示中心全场景实战演示(https://redis.io/demo-center/)
- 参考架构直接部署无需摸索(https://redis.io/resources/architecture-diagrams/)
资源(https://redis.io/langcache/?utm_source=influencer&utm_medium=paid-post&utm_campaign=2026-09-ai_in_production-influencer&utm_content=a-pachaar-x#)
Ulta标志
通过Redis赋能的在线体验实现40%收入增长了解详情
Superlinked标志
基于Redis处理每秒100+向量搜索查询了解详情
Sony LIV标志
API响应速度提升37%,内存占用降低15%了解详情
plivo标志
通过Redis处理超十亿月度API请求了解详情
最新动态
图片
办公时间:为何你的智能体总是偏离主题
2026年9月9日
相似文章
@addyosmani: 将AI投入生产?您的大量token账单都花在重复回答同一问题上 - 而代理消耗约4倍的聊天token。
一条推文推广Redis LangCache作为一种托管语义缓存解决方案,用于AI生产,声称API成本可降低高达90%。
@Alacritic_Super: 正在构建AI应用?使用Rust构建的LLM Cache降低API成本并加快响应速度!每次用户…
本文介绍了一个用Rust构建的LLM Cache,通过精确匹配和语义匹配重用之前的答案,以降低API成本并加快响应速度。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…
本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。
@techNmak: 你的LLM推理正在消耗50%的计算资源在已经完成的工作上。如果你正在运行RAG或多轮对话,……
LMCache是一个开源库,它使KV缓存持久化并可在请求之间共享,消除了RAG和多轮对话工作负载中的重复计算,实现了高达15倍的吞吐量提升和3-10倍的首令牌时间减少。