我构建了面向智能体的提示缓存感知无损压缩
摘要
一个专为AI智能体设计的提示缓存无损压缩工具。
暂无内容
相似文章
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2062553418460479577
一款名为Headroom的开源工具采用可逆的Compress-Cache-Retrieve架构,能将AI智能体上下文压缩高达90%,使模型能够在需要时检索原始细节,而非永久丢弃。
缓存感知的提示压缩:大语言模型API缓存的双层成本模型
提出了一种缓存感知的提示压缩(CAPC)方法,该方法将查询无关的压缩与缓存相结合,以降低大语言模型API的成本,在Anthropic的Sonnet API和生产工作负载上展现出显著优于现有方法的节省效果。
我如何在长时间智能体运行中轻松减少约90%的输入token消耗
作者分享了一个实用技巧,通过提示缓存(prompt caching)在长时间智能体运行中将输入token成本降低约90%:将不变文本(系统提示、工具定义、上下文)放在每个提示的开头,以利用LLM提供商的缓存前缀。
AGORA: 基于适配器的观测-动作保留——用于LLM代理的无推理提示压缩
AGORA 引入了一种用于LLM代理的无推理步骤级提示压缩器,避免了令牌级压缩器的'动作语法破坏'失效模式。它通过结构解析器、始终保留底限以及学习的相关性评分器,在9个环境中的8个(跨骨干网络)保留了≥75%的未压缩性能。
API 中的提示词缓存
OpenAI 推出提示词缓存功能,这是一项自动特性,通过在 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 模型上重用最近缓存的输入令牌,可将 API 成本降低 50% 并改善延迟。该功能会自动应用于超过 1,024 个令牌的提示词,无需开发者进行集成更改。