标签
用户描述了在使用pi.dev插件管理本地AI模型的上下文、压缩和内存时遇到的困难,并寻求能够处理不同模型上下文窗口和VRAM限制的解决方案建议。
本文讨论了GPT Astra中的一种新上下文管理策略,该策略避免使用压缩,而是将目标、决策和进度写入服务器端笔记,从而在切换上下文时无需生成对话摘要。
本文主张,AI智能体中的上下文管理应被视为一个生命周期架构问题,并提出了智能体上下文管理框架,包含五个基本要素与一个参考实现,该实现已取得高基准测试分数。
本文解释了 Pi 编码代理中压缩的工作原理,即在上下文窗口接近限制时对旧对话历史进行总结,并详细介绍了 Pi 的具体实现和触发条件。
文章解释了“上下文腐烂”:随着上下文增长,AI 智能体在长任务上表现下降,甚至在窗口未满时就开始退化,并提供了压缩、状态卸载、按需检索等技术来保持可靠性。
作者分析了 Codex 的 Remote Compaction v2 数据流,包括触发条件、请求处理、服务端密文返回和客户端上下文重建的完整流程,指出摘要模型与加密密钥均在 OpenAI 侧。
OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。
OpenAI发现,在API工具中启用保留推理和压缩设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提高了三倍,同时将输出令牌减少了6倍,表明基准测试性能在很大程度上受工具设计影响。
ARC通过将仅追加存储与有界引用视图分离,提高了长上下文AI智能体的检索效率和准确率,实现了近乎完美的召回率,同时降低了延迟和带宽消耗。
本文识别了自主LLM工具(如Claude Code)中的一种失效模式:会话压缩摘要将超时命令的部分终端输出误解为已确认结果,从而在跨会话和模型版本中传播误报,且未重新验证。
GreptimeDB的Mito2存储引擎采用LSM-tree设计,结合列式Parquet SST、三级扫描剪枝以及TWCS压缩。该博客文章对其架构进行了全面解析。
SelfCompact是一种脚手架方法,让语言模型自主决定何时以及如何压缩长智能体轨迹,相比固定间隔方法,在减少token成本的同时实现了更好的性能。
Snapcompact 是一种技术,它将文本渲染为密集的像素字体图像,用更便宜的图像Token替换文本Token,以极低的输入成本实现近乎逐字逐句的召回。
LANTERN 引入了一个轻量级记忆层,能够在对话压缩后归档对话轮次并检索相关细节,恢复了78.3%丢失的事实,且无需任何LLM调用,性能优于基于MemGPT的方法。
一位用户分享了一个自定义的插件SDK钩子,该钩子逐渐压缩较早的轮次,同时保留最近的轮次不压缩,以防止在长时间OpenClaw会话中上下文窗口耗尽,将重新发送的上下文减少了80%。