prompt-caching

标签

Cards List
#prompt-caching

@dejavucoder: 现在很多人在讨论提示缓存和推理优化。我曾经写过一篇很长的博客…

X AI KOLs Timeline · 20小时前 缓存

本文解释了提示缓存如何在LLM推理中使用分页注意力和前缀缓存工作,并提供了开发者优化性能的实用技巧。

0 人收藏 0 人点赞
#prompt-caching

2026年最佳LLM网关的竞争中,谁将领跑?

Reddit r/LocalLLaMA · 22小时前

本文探讨了寻找2026年最佳LLM网关的过程,重点强调了企业级功能,如提示缓存、细粒度成本归属以及对推理模型的支持。

0 人收藏 0 人点赞
#prompt-caching

我使用GLM、Kimi、Opus和GPT测试了DeepSeek Harness,以查看提示缓存是否仍能与其他模型一起工作

Reddit r/AI_Agents · 4天前

本文测试了DeepSeek Harness在使用其他AI模型时是否保持高提示缓存率,发现GLM和Kimi实现了97-99%的缓存重用,而Opus没有显示缓存活动,GPT测试失败。

0 人收藏 0 人点赞
#prompt-caching

@LangChain: 了解 @unifygtm 如何在发布前两周将模型成本削减90-95%,详见上周的 Max Agency YouTube 剧集:https:…

X AI KOLs Timeline · 4天前 缓存

Unify GTM 通过架构优化和提示缓存将AI模型成本降低了90-95%,强调了对抗性判断模型对于可扩展销售AI代理的重要性。

0 人收藏 0 人点赞
#prompt-caching

@LanLance24: Pi 发布了一篇博客详解他们的压缩机制设计,把上下文怎么膨胀、压缩怎么触发、缓存付出什么代价等进行了深入分析。

X AI KOLs Timeline · 6天前 缓存

本文详细介绍了Pi编码代理的上下文压缩机制,分析了上下文膨胀原因、压缩触发条件以及缓存失效的代价,旨在优化长对话中的AI性能。

0 人收藏 0 人点赞
#prompt-caching

@Xudong07452910: Anthropic 刚写了一篇很实用的 Claude Code 使用指南。 里面有个细节我之前没有太认真想过: Claude 读过的文件、跑过的测试、终端输出,一旦进入当前 Session,后面每一轮基本都会继续带着它们。 所以一个 Cl…

X AI KOLs Timeline · 2026-08-16 缓存

Anthropic published a practical guide for Claude Code, emphasizing context management through session commands and discussing token optimization and prompt caching to improve efficiency in AI-assisted coding.

0 人收藏 0 人点赞
#prompt-caching

@rohanpaul_ai: Grok 4.6 在代理循环效率上击败 GPT-5.6 Sol,在相同的3次构建中花费13.11美元对比20.18美元。Grok 4.6'…

X AI KOLs Timeline · 2026-08-15 缓存

文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。

0 人收藏 0 人点赞
#prompt-caching

@Saboo_Shubham_: Anthropic刚发布了如何运行Claude Code而不浪费token。你的提示缓存一小时后过期。运行/c…

X AI KOLs Timeline · 2026-08-15 缓存

Anthropic发布了如何通过在提示缓存过期之前使用/compact命令来高效运行Claude Code的说明,以节省token。

0 人收藏 0 人点赞
#prompt-caching

最大化 Claude Code 会话价值

Hacker News Top · 2026-08-14 缓存

本文详细介绍了如何通过分析输入/输出 token 成本、提示缓存机制以及效率优化技巧,来最大化 Claude Code 会话的价值。

0 人收藏 0 人点赞
#prompt-caching

DeepSeek-V4-Flash-0731 用户的 PSA——不要在对话中途用系统角色消息破坏提示缓存

Reddit r/LocalLLaMA · 2026-08-02

这则 PSA 提醒 DeepSeek-V4-Flash-0731 用户:系统角色消息会被提升到最顶部,破坏提示缓存和邻近性,并建议改用 latest_reminder。

0 人收藏 0 人点赞
#prompt-caching

@digitalocean: 停止为每次LLM请求重复处理相同上下文付费。DigitalOcean AI-Native Cloud上的提示缓存自动…

X AI KOLs Timeline · 2026-07-29 缓存

DigitalOcean推出了LLM推理的提示缓存功能,自动缓存系统提示等重复上下文,无需更改代码即可将输入令牌成本降低多达80%,并附有关于盈亏平衡计算的详细教程。

0 人收藏 0 人点赞
#prompt-caching

@github: 每次 Copilot 会话中更多部分用于有效工作,因此你的积分更耐用,使用方式不变。Prom…

X AI KOLs Timeline · 2026-07-27 缓存

GitHub Copilot 现在使用提示缓存、工具搜索和自动模型选择(HyDRA)来降低成本并提高效率,实现了 3.3 倍的节省,同时与 OpenRouter Auto 的解决率相匹配。

0 人收藏 0 人点赞
#prompt-caching

代理中的提示缓存

Lobsters Hottest · 2026-07-23 缓存

本文解释了提示缓存在大语言模型代理中的工作原理,涵盖 KV 缓存机制、预填充和解码阶段,以及其对延迟、成本和代理设计的影响。

0 人收藏 0 人点赞
#prompt-caching

提示缓存真的能为AI代理节省可观成本吗?

Reddit r/AI_Agents · 2026-07-22

一个实践性讨论,质疑提示缓存是否能为生产环境中的AI代理带来有意义的成本节约,审视了现实因素如缓存命中率、路由策略和规模。

0 人收藏 0 人点赞
#prompt-caching

我构建了面向智能体的提示缓存感知无损压缩

Reddit r/AI_Agents · 2026-07-21

一个专为AI智能体设计的提示缓存无损压缩工具。

0 人收藏 0 人点赞
#prompt-caching

@akshay_pachaar:你的 KV 缓存中 90% 从未被重用。(提示缓存从未旨在解决此问题)如果你的系统提示和工具定义…

X AI KOLs Following · 2026-07-20 缓存

CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。

0 人收藏 0 人点赞
#prompt-caching

@_avichawla: 一个棘手的LLM面试题:你的代理把所有任务都跑在前沿LLM上,于是你加了一个路由层,将一些简单的调用发送到价格便宜15倍的LLM。

X AI KOLs Timeline · 2026-07-11 缓存

解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。

0 人收藏 0 人点赞
#prompt-caching

@bojie_li:如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具……

X AI KOLs Timeline · 2026-07-06 缓存

研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。

0 人收藏 0 人点赞
#prompt-caching

我构建了一个Claude智能体,为一家拥有7家分店的寿司连锁店处理Instagram私信订单

Reddit r/artificial · 2026-07-06

一名开发者使用Claude Sonnet 4.6构建了一个AI智能体,为一家7家分店的寿司连锁店处理Instagram私信订单,并利用提示缓存在降低成本的同时保持高效。

0 人收藏 0 人点赞
#prompt-caching

为什么感觉大型LLM提供商在故意隐藏提示缓存?

Reddit r/artificial · 2026-07-01

一篇文章讨论提示缓存如何大幅降低LLM API成本,指出提供商对此解释不足,并提供一个简单的规则来构建提示以获得最大缓存命中率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈