GPT-6的更优提示缓存
摘要
OpenAI宣布为GPT-6改进提示缓存,提供更高的缓存命中率、折扣以及用于监控和优化的新工具。
了解GPT-6如何通过更高的缓存命中率、新的诊断工具、显式断点以及减少延迟和成本的控制措施来改进提示缓存。
查看缓存全文
缓存时间: 2026/09/22 22:01
# GPT-6 提升提示缓存效能
来源:https://openai.com/index/better-prompt-caching-for-gpt-6/
GPT-6 使持久化代理能够长时间处理复杂任务,从重构代码库到制作深度研究报告及演示文稿。这些代理背后的应用程序会发起一系列相互关联的 API 请求,通常延续先前的指令、工具定义和上下文信息。OpenAI 会缓存这些共享上下文,以便在不同请求中重复利用计算资源,从而缩短响应时间,并为开发者提供缓存输入令牌最高达 90% 的费用减免。
我们推出的 GPT-6 系列模型采用了改进的提示缓存系统,默认提供更高的缓存命中率。现在,我们对 30 分钟窗口内复用的合格共享前缀提供缓存折扣。同时,我们还引入了新工具,帮助开发者监控缓存性能、诊断未命中情况,并选择需要缓存的提示内容范围。
## 监控缓存与诊断未命中
全新的[提示缓存仪表板](https://platform.openai.com/usage?usage_section=prompt-caching)可展示应用程序中有多大比例的输入内容来自缓存。您可以追踪命中率随时间的变化,并通过输入构成图表对比缓存与非缓存令牌。这些视图有助于发现缓存命中率下降问题,并评估应用程序变更对缓存性能的影响。
当遇到意外的缓存未命中时,请使用[缓存诊断工具](https://developers.openai.com/api/docs/guides/prompt-caching/diagnostics)分析原因。通过对比请求与近期响应,可识别模型、工具、设置或输入中阻碍复用的变更。受影响令牌的估算数量有助于评估影响范围,进而决定如何优化集成以实现最高缓存命中率。
```json
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
```
## 优化应用程序缓存策略
**选择缓存内容:** 通过显式缓存断点可指定需要复用的提示前缀。更新的[提示缓存指南](https://developers.openai.com/api/docs/guides/prompt-caching)详细说明了使用方法、缓存前缀的有效时长,以及工具和输入变更对复用性的影响。
**调整推理强度而不破坏缓存:** 在 GPT-6 模型中,您现在可以在不破坏缓存的情况下,[调整不同响应间的推理强度](https://developers.openai.com/api/docs/guides/reasoning?api-mode=responses#change-reasoning-mid-conversation)。可通过附加 `configuration_update` 参数为复杂任务增强推理强度,或为常规后续操作降低强度,同时保持请求级推理强度设置不变。这样就能在保留可复用上下文的同时,灵活调整任务所需推理资源。
**在工具和指令变更时保护缓存:** 当代理的工具使用需求变化时,保持工具定义、模式和顺序的稳定性,使早期上下文保持可复用性。使用 `allowed_tools` 仅激活相关工具,或在无需工具时将 tool_choice 设为 none,而非直接移除定义。通过新的开发者消息在上下文末尾添加新指令以覆盖旧指令。参见我们的[工具变更管理指南](https://developers.openai.com/api/docs/guides/prompt-caching#manage-tools-with-append-only-updates)。
**预热缓存降低延迟:** [预热](https://developers.openai.com/api/docs/guides/prompt-caching#prewarm-the-cache)功能可提前准备已知上下文,使模型在收到请求时能更快开始响应。例如,应用程序可在启动时预热共享指令、工具定义或参考资料,无需等待用户首次提问。这将处理过程移出用户的等待时间。
这些可选控制功能基于引擎的默认性能构建,帮助您根据工作负载定制缓存策略。
## 开始使用
- 在[提示缓存仪表板](https://platform.openai.com/usage?usage_section=prompt-caching)中监控缓存命中率。
- 使用[诊断工具](https://developers.openai.com/api/docs/guides/prompt-caching/diagnostics)调查意外未命中情况。
- 按照[提示缓存指南](https://developers.openai.com/api/docs/guides/prompt-caching)优化设置,或使用 [Codex](https://developers.openai.com/api/docs/guides/prompt-caching#how-to-optimize-prompt-caching) 审查代码、应用改进并评估效果。
相似文章
API 中的提示词缓存
OpenAI 推出提示词缓存功能,这是一项自动特性,通过在 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 模型上重用最近缓存的输入令牌,可将 API 成本降低 50% 并改善延迟。该功能会自动应用于超过 1,024 个令牌的提示词,无需开发者进行集成更改。
面向开发者推出GPT-5.1
OpenAI发布了GPT-5.1,这是GPT-5系列中的一个新模型,它可以基于任务复杂度动态调整思考时间,在保持前沿智能的同时,性能比GPT-5快2-3倍。此次发布包括扩展的提示缓存(24小时保留)、新的编码工具(apply_patch和shell),以及针对延迟敏感应用的“无推理”模式。
提示缓存,但用于 RL 训练——在长提示/短回复负载上实现 7.5 倍加速
一种面向开源 RL 训练引擎的全新优化技术在训练过程中引入了提示缓存,通过减少冗余计算,在长提示、短回复负载场景下实现了高达 7.5 倍的加速。
停止缩短你的提示词。六个智能体,97-99%的缓存命中率——以及为什么标准建议是错误的。
文章指出,通过提示缓存,较长且稳定的提示可能比频繁更改的短提示更便宜,分享了运行具有高缓存命中率的AI智能体的见解。
@LangChain: OpenAI的提示缓存使请求成本降低90%,但缓存密钥的上限约为每秒15次请求。@HeggieCon…
OpenAI的提示缓存将请求成本降低了90%,但缓存密钥限制为每秒15次请求。Unify GTM构建了一个自定义路由解决方案来绕过这个限制,实现了95%的缓存命中率。