标签
本文解释了提示缓存如何在LLM推理中使用分页注意力和前缀缓存工作,并提供了开发者优化性能的实用技巧。
本文探讨了寻找2026年最佳LLM网关的过程,重点强调了企业级功能,如提示缓存、细粒度成本归属以及对推理模型的支持。
本文测试了DeepSeek Harness在使用其他AI模型时是否保持高提示缓存率,发现GLM和Kimi实现了97-99%的缓存重用,而Opus没有显示缓存活动,GPT测试失败。
Unify GTM 通过架构优化和提示缓存将AI模型成本降低了90-95%,强调了对抗性判断模型对于可扩展销售AI代理的重要性。
本文详细介绍了Pi编码代理的上下文压缩机制,分析了上下文膨胀原因、压缩触发条件以及缓存失效的代价,旨在优化长对话中的AI性能。
Anthropic published a practical guide for Claude Code, emphasizing context management through session commands and discussing token optimization and prompt caching to improve efficiency in AI-assisted coding.
文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。
Anthropic发布了如何通过在提示缓存过期之前使用/compact命令来高效运行Claude Code的说明,以节省token。
本文详细介绍了如何通过分析输入/输出 token 成本、提示缓存机制以及效率优化技巧,来最大化 Claude Code 会话的价值。
这则 PSA 提醒 DeepSeek-V4-Flash-0731 用户:系统角色消息会被提升到最顶部,破坏提示缓存和邻近性,并建议改用 latest_reminder。
DigitalOcean推出了LLM推理的提示缓存功能,自动缓存系统提示等重复上下文,无需更改代码即可将输入令牌成本降低多达80%,并附有关于盈亏平衡计算的详细教程。
GitHub Copilot 现在使用提示缓存、工具搜索和自动模型选择(HyDRA)来降低成本并提高效率,实现了 3.3 倍的节省,同时与 OpenRouter Auto 的解决率相匹配。
一个实践性讨论,质疑提示缓存是否能为生产环境中的AI代理带来有意义的成本节约,审视了现实因素如缓存命中率、路由策略和规模。
CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。
解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。
研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。
一名开发者使用Claude Sonnet 4.6构建了一个AI智能体,为一家7家分店的寿司连锁店处理Instagram私信订单,并利用提示缓存在降低成本的同时保持高效。
一篇文章讨论提示缓存如何大幅降低LLM API成本,指出提供商对此解释不足,并提供一个简单的规则来构建提示以获得最大缓存命中率。