@akshay_pachaar: RAG vs. CAG,清晰解释!RAG 很棒,但有一个主要问题:每次查询都命中向量数据库,即使是静态数据也是如此……
摘要
解释了缓存增强生成(CAG)作为一种将静态知识直接缓存到模型 KV 内存中的方法,与传统 RAG 相比,可降低延迟和成本,并展示了如何将两者结合以获得最佳性能。
查看缓存全文
缓存时间: 2026/05/19 14:48
RAG vs. CAG,清晰解读!
RAG 很好,但它有一个显著问题:
每个查询都要访问向量数据库。即使是对几个月未变的静态信息也是如此。
这样做昂贵、缓慢,且不必要。
缓存增强生成(CAG)通过让模型直接在其键值(KV)记忆中“记住”静态信息,解决了这一问题。
实际上,你可以将 RAG 与 CAG 结合,实现两全其美。
具体原理如下:
RAG + CAG 将你的知识分为两个层次:
↳ 静态数据(策略、文档)被一次性缓存到模型的 KV 记忆中
↳ 动态数据(近期更新、实时文档)则通过检索获取
这样能带来更快的推理速度、更低的成本,并减少冗余。
关键在于有选择地缓存。
只缓存那些极少变化的、高价值的静态知识。如果缓存所有内容,你会触及上下文限制。将“冷”数据(可缓存)与“热”数据(可检索)分离,才能保持系统可靠。
今天就可以开始实践。OpenAI 和 Anthropic 的 API 已经支持提示缓存(prompt caching)。
如果你想深入了解,我在下方附上了最近关于提示缓存的文章。
你是否已经在生产环境中尝试过 CAG?
下面引用了我就提示缓存以及 Claude Code 如何实现 92% 缓存命中率所写的一篇文章。不妨一读。
相似文章
@akshay_pachaar: RAG vs. Graph RAG vs. Agentic RAG,清晰说明!标准RAG将文档嵌入向量并检索最相关…
清晰解释标准RAG、Graph RAG和Agentic RAG,涵盖它们的区别、用例以及如何处理单跳与多跳查询。
@akshay_pachaar: 朴素 RAG vs. Blockify!一种全新的 RAG 方案:- 语料库体积缩减 40 倍 - 每次查询 token 用量减少 3 倍 -…
Blockify 是一个新的开源 RAG 框架,以专利技术「IdeaBlocks」流水线取代传统分块方式,声称可实现语料库体积缩减 40 倍、token 使用效率提升 3 倍、向量搜索准确率提升 2.3 倍。它将企业文档转化为结构化 XML 知识单元,以实现更连贯的 LLM 检索效果。
@LearnWithBrij:别再像2022年那样构建RAG了。分块→嵌入→检索→生成 这条流水线能用……直到你尝试上线……
一个帖子解释了构建生产级RAG超越简单分块-嵌入-检索-生成所需的四个关键层次:智能查询路由、高级索引、多类型检索和持续评估。
@_rohit_tiwari_: 我浪费了几个月试图理解RAG。所以我制作了这个清晰的逐步指南。https://drive.google.com/file/d/1…
一份清晰的逐步指南,帮助理解检索增强生成(RAG),涵盖解释、视觉内容以及各种架构,如Naïve RAG、Advanced RAG、Graph RAG、Multimodal RAG和Agentic RAG。
@_avichawla: 面向AI工程师的8种RAG架构:(用法说明)1)Naive RAG——纯粹基于向量相似度检索文档…
一个推文串,解释了8种不同的RAG架构(Naive、Multimodal、HyDE、Corrective、Graph、Hybrid、Adaptive、Agentic)及其使用场景,并暗示了一种改进的索引技术。