标签
MiniCache 是一个程序缓存框架,通过参数化思维程序(Program-of-Thought)来复用相似请求间的计算,使用小模型进行语义变量提取和推测性草拟,从而提高大语言模型推理效率。
本文介绍了一个用Rust构建的LLM Cache,通过精确匹配和语义匹配重用之前的答案,以降低API成本并加快响应速度。
本文提出一种形式化理论,用于在受控对话AI系统中定义答案重用,用数学刻画的已解析话语的商空间取代相似性启发式方法。
Firn 是一个开源的多租户向量与全文搜索引擎,基于 AWS S3 等对象存储,提供分层存储架构,配备 RAM 和 NVMe 缓存以提升性能。通过 IVF_PQ 索引实现亚秒级冷查询,并通过结果缓存实现微秒级热命中。
本文介绍了通过构建智能缓存网关(Hawiyat Composer)如何利用精确匹配缓存、语义缓存、模型路由和本地路由消除重复的token浪费,从而节省大量AI API成本。
本文提出了一种记忆增强的多智能体架构,采用嵌套学习、连续记忆系统和语义缓存来缓解LLM流程中的幻觉问题,在显著减少事实错误的同时提高了运营效率。
文章讨论了像 Redis Iris 这样的“代理上下文引擎”作为运行时层的出现,它结合了检索、记忆、数据同步和缓存,使代理能够使用实时业务数据,而无需为每个工作流进行自定义集成。