标签
GLib 采用了 libffi 的新 ffi_call_plan 缓存,将 GClosure 调用开销降低 10-25%,并已提交合并请求以及用于性能分析的帧指针补丁。
MiniCache 是一个程序缓存框架,通过参数化思维程序(Program-of-Thought)来复用相似请求间的计算,使用小模型进行语义变量提取和推测性草拟,从而提高大语言模型推理效率。
本文提出了一种面向多智能体系统的工作负载感知缓存逐出策略,该策略利用重新计算成本、DAG依赖计数和智能体调用频率来保留有价值的缓存条目,相比于无缓存基线最多可将延迟降低64.7%,相比于次优的有限容量方法平均可降低31.1%。
Guillermo Rauch 宣布 Vercel 现在跨部署缓存不可变的静态资源,使部署速度提升最多 30%,首字节时间改善 60%。
精心整理的资源列表,用于掌握LLM缓存管理,包括关于KV缓存、前缀缓存及相关技术的解释、教程和研究论文。
LaCache 提出了一种针对扩散式LLM的无训练加速框架,利用无损缓存和精度自适应推理消除去噪步骤中的冗余计算,在保持任务精度的同时实现了高达40.2倍的端到端加速。
提出了一种缓存感知的提示压缩(CAPC)方法,该方法将查询无关的压缩与缓存相结合,以降低大语言模型API的成本,在Anthropic的Sonnet API和生产工作负载上展现出显著优于现有方法的节省效果。
IBM Research 解释了为什么智能体系统中的模型路由比简单的分类问题更复杂,指出缓存和隐藏因素(如实际工作负载成本和任务难度评估)使路由成为一个系统优化挑战。
Simon Willison 分享了一种以缓存友好的方式在 GitHub Actions 中使用 uvx 的方法,通过设置环境变量并将其纳入缓存键,以避免重复下载 PyPI。
一项比较Claude Code和OpenCode的研究显示,Claude Code在读取提示前发送33k tokens,而OpenCode仅发送7k tokens,凸显了Claude Code在缓存策略和令牌使用上的显著低效。
llama.cpp b9966 引入了一个针对 -sm tensor 模式的修复,该修复缓存了正则表达式模式,消除了解码线程中每个张量每个标记的 29 次重新编译,从而显著减少了 CPU 开销。
Reame 是一个基于 llama.cpp 构建的 LLM 推理服务器,通过缓存提示前缀和生成的 n-gram 来优化 CPU 硬件,随着重复使用变得越来越快。它专为廉价硬件设计,如共享 vCPU 和免费套餐,适用于重复性的 AI 工作负载,例如文档提取和批量处理管道。
推测性缓存预热在用户输入提示词时预先处理系统提示词和工具数组,从而在本地LLM推理中节省10-20秒的等待时间。该功能是用于本地AI的开源OpenFox框架的一部分,可在不破坏缓存一致性的前提下提升交互性。
搜狐开源了其内部Redis云管理平台CacheCloud,支持单机、哨兵、集群模式,提供一键搭建、监控告警、弹性扩容等功能,已在GitHub获得近9000星,采用Apache-2.0协议。
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
本文解释了为什么在x64上伪共享对齐应为128字节而不是通常的64字节,这是因为Intel Sandy Bridge的空间预取器会成对加载缓存行,文章提供了推理和一个展示改进的基准测试。
本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。
全面论证:在考虑额外专用系统之前,PostgreSQL 本身已能满足大多数应用需求,包括缓存、搜索、任务队列和文档存储。
一份关于 Hermes Mixture-of-Agents (MoA) 研究结果的技术报告,包括基准测试结果、缓存经济学、GPU 拓扑结构研究以及未来开发路线图。
作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。