prompt-caching

标签

Cards List
#prompt-caching

@github: 每次 Copilot 会话中更多部分用于有效工作,因此你的积分更耐用,使用方式不变。Prom…

X AI KOLs Timeline · 11小时前 缓存

GitHub Copilot 现在使用提示缓存、工具搜索和自动模型选择(HyDRA)来降低成本并提高效率,实现了 3.3 倍的节省,同时与 OpenRouter Auto 的解决率相匹配。

0 人收藏 0 人点赞
#prompt-caching

代理中的提示缓存

Lobsters Hottest · 4天前 缓存

本文解释了提示缓存在大语言模型代理中的工作原理,涵盖 KV 缓存机制、预填充和解码阶段,以及其对延迟、成本和代理设计的影响。

0 人收藏 0 人点赞
#prompt-caching

提示缓存真的能为AI代理节省可观成本吗?

Reddit r/AI_Agents · 6天前

一个实践性讨论,质疑提示缓存是否能为生产环境中的AI代理带来有意义的成本节约,审视了现实因素如缓存命中率、路由策略和规模。

0 人收藏 0 人点赞
#prompt-caching

我构建了面向智能体的提示缓存感知无损压缩

Reddit r/AI_Agents · 6天前

一个专为AI智能体设计的提示缓存无损压缩工具。

0 人收藏 0 人点赞
#prompt-caching

@akshay_pachaar:你的 KV 缓存中 90% 从未被重用。(提示缓存从未旨在解决此问题)如果你的系统提示和工具定义…

X AI KOLs Following · 2026-07-20 缓存

CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。

0 人收藏 0 人点赞
#prompt-caching

@_avichawla: 一个棘手的LLM面试题:你的代理把所有任务都跑在前沿LLM上,于是你加了一个路由层,将一些简单的调用发送到价格便宜15倍的LLM。

X AI KOLs Timeline · 2026-07-11 缓存

解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。

0 人收藏 0 人点赞
#prompt-caching

@bojie_li:如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具……

X AI KOLs Timeline · 2026-07-06 缓存

研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。

0 人收藏 0 人点赞
#prompt-caching

我构建了一个Claude智能体,为一家拥有7家分店的寿司连锁店处理Instagram私信订单

Reddit r/artificial · 2026-07-06

一名开发者使用Claude Sonnet 4.6构建了一个AI智能体,为一家7家分店的寿司连锁店处理Instagram私信订单,并利用提示缓存在降低成本的同时保持高效。

0 人收藏 0 人点赞
#prompt-caching

为什么感觉大型LLM提供商在故意隐藏提示缓存?

Reddit r/artificial · 2026-07-01

一篇文章讨论提示缓存如何大幅降低LLM API成本,指出提供商对此解释不足,并提供一个简单的规则来构建提示以获得最大缓存命中率。

0 人收藏 0 人点赞
#prompt-caching

@FinanceYF5: Claude 正式进驻 Microsoft Foundry,今天起全面开放 Azure 账号直接用,身份验证、计费、合规管控全套沿用现有体系 首批上线:Claude Opus 4.8 和 Haiku 4.5,支持 prompt cachi…

X AI KOLs Timeline · 2026-06-30 缓存

Claude is now officially available on Microsoft Foundry, allowing Azure accounts to use it directly with existing authentication, billing, and compliance. The initial rollout includes Claude Opus 4.8 and Haiku 4.5, supporting prompt caching and extended thinking.

0 人收藏 0 人点赞
#prompt-caching

@LangChain:Alex 最近加入了 @LangChain_OSS 团队,并发表了他的第一篇文章,关于 Deep Agents 如何使用提示缓存…

X AI KOLs Timeline · 2026-06-26 缓存

Alex 是 LangChain 团队的新成员,发表了一篇文章,解释 Deep Agents 如何使用提示缓存来降低 API 成本。

0 人收藏 0 人点赞
#prompt-caching

Fable 5 使得代理构建者必须采用成本感知模型路由

Reddit r/AI_Agents · 2026-06-09

Anthropic 发布了 Fable 5,这是一款价格高昂的强大新模型,由于令牌扇出和高输出成本,使得成本感知路由对代理构建者来说至关重要。

0 人收藏 0 人点赞
#prompt-caching

我如何在长时间智能体运行中轻松减少约90%的输入token消耗

Reddit r/AI_Agents · 2026-06-01

作者分享了一个实用技巧,通过提示缓存(prompt caching)在长时间智能体运行中将输入token成本降低约90%:将不变文本(系统提示、工具定义、上下文)放在每个提示的开头,以利用LLM提供商的缓存前缀。

0 人收藏 0 人点赞
#prompt-caching

测量了执行相同任务的4个代理运行时的令牌消耗。成本从1倍到4倍不等,取决于缓存架构

Reddit r/AI_Agents · 2026-05-27

对四个代理运行时(Claude Code、OpenClaw、Hermes 和 OpenClacky)在相同任务上的令牌消耗进行比较显示,相对于 Claude Code,成本从0.8倍到4倍不等,这由缓存架构和工具模式设计的差异驱动。

0 人收藏 0 人点赞
#prompt-caching

@freeman1266: 通过优化策略和模型路由,将每月数千美元的 AI 编程成本大幅削减 80% 如果低效的上下文管理和盲目使用高昂模型,将会使账单飞涨。 通过实施提示词缓存、精简上下文文件以及修复工具调用的自动循环,开发者可以显著减少无效的 Token 消耗。…

X AI KOLs Timeline · 2026-05-26

本文介绍了通过提示词缓存、精简上下文、多模型路由(将日常编码任务交给Kimi 2.6,核心架构用高级模型)等策略,将AI编程成本削减80%的实用技巧。

0 人收藏 0 人点赞
#prompt-caching

@pallavishekhar_: 如何减少AI代理中的Token使用?我们来理解一下。AI代理使用LLM进行思考、规划和推荐工具。每一步…

X AI KOLs Timeline · 2026-05-22 缓存

本帖子分享了减少AI代理中Token使用的策略,包括提示缓存、上下文摘要、使用较小模型、修剪工具输出、子代理、RAG以及紧凑的系统提示。

0 人收藏 0 人点赞
#prompt-caching

@nateherk: https://x.com/nateherk/status/2057450555212013627

X AI KOLs Timeline · 2026-05-21 缓存

一份实用指南,解释Claude Code中的提示缓存工作原理,如何将Token成本降低90%,以及常见的破坏缓存的习惯,帮助开发者延长会话时长并降低成本。

0 人收藏 0 人点赞
#prompt-caching

降低LLM API成本的10种方法

Reddit r/AI_Agents · 2026-05-20

一份实用指南,列出了使用LLM API时降低成本的10种策略,包括模型选择、提示缓存、批处理以及监控费用。

0 人收藏 0 人点赞
#prompt-caching

@akshay_pachaar: RAG vs. CAG,清晰解释!RAG 很棒,但有一个主要问题:每次查询都命中向量数据库,即使是静态数据也是如此……

X AI KOLs Following · 2026-05-19 缓存

解释了缓存增强生成(CAG)作为一种将静态知识直接缓存到模型 KV 内存中的方法,与传统 RAG 相比,可降低延迟和成本,并展示了如何将两者结合以获得最佳性能。

0 人收藏 0 人点赞
#prompt-caching

每个AI提示都需花费成本——这改变了一切

Reddit r/AI_Agents · 2026-05-18

文章认为,AI的真正挑战不仅在于构建更智能的模型,更在于以规模化的方式降低成本效率,强调了减少token使用、提升速度以及优化基础设施的重要性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈