标签
一篇论文提出了一种结构化的会话压缩方法,将聊天历史建模为带有快照和分支的DAG,在保留语义的同时修剪冗余,在编码会话中平均削减20%的token。
分享了一个在Codex中快速获取上下文并节省token的技巧:当会话上下文快满时,开新会话并引用旧会话总结核心信息,继续任务执行。
一位开发者分享了在Cursor、Claude Code和Codex之间切换时丢失上下文的困扰,以及他们如何使用MEMMY解决这一问题。MEMMY是一个将聊天历史同步到所有代理共享记忆中心的工具。
探讨了谁应负责保持AI模型上下文最新状态的问题,并论述了提供者、开发者和用户在维护信息时效性方面的角色。
一位开发者分享了一个精心整理的安装程序,其中打包了11个Token优化工具,帮助AI代理管理上下文并减少Token使用量,同时向社区征求额外建议,特别是针对多代理设置。
本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。
Hermes 的 Profile 功能让不同的 AI Agent(如编程、研究、私人事务)拥有独立的配置、记忆和任务,实现身份隔离,解决长期运行中的上下文混乱问题。
Unibase Memory 是一款 Chrome 扩展程序,可在 ChatGPT、Claude 和 Gemini 之间实现共享记忆,让用户能够捕获、搜索和注入 AI 对话到任何工具中,无需重复解释上下文。
Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。
这篇 ICML 论文介绍了递归模型,这些模型递归地调用自身在隔离上下文中解决子任务,证明它们可以在长时推理中超越上下文受限的自回归模型。在 SAT 求解和围棋博弈树搜索上的实验表明,使用较小的活动上下文能提高准确性。
Akashic提出了MemAttention,一种用于LLM推理的低开销内存系统,将上下文组织成有界块并建模语义关系,相比先前基线方法,准确率最高提升10.2个百分点,吞吐量最高提升1.21倍。
本文提出了一种更简洁的 Agent 网页访问模式,通过将功能拆分为三个独立的通道——搜索(search)、抓取(fetch)和浏览器(browser),并借助一个阅读器子代理(reader subagent)避免原始页面进入主上下文,从而显著降低 Token 消耗和上下文污染。
一位开发者讲述了构建PRAANA(一个面向编码代理的主动上下文策展器)的经历,详细描述了诸如语义召回损坏和测量缺失等错误,并强调了在优化之前使用诚实工具和进行测量的重要性。
一位CIO分享了对将语义层和本体应用于企业AI代理所面临挑战的观察,强调了动态上下文选择、持续演进机构知识以及表达判断而非仅仅静态事实的需求。
Toolport是一款开源工具,可让你使用多个MCP服务器而无需消耗上下文Token,提供诸如检测抽地毯骗局等安全功能,并能在不同AI智能体之间无缝导入/导出MCP配置。
Self-GC 为长时域 LLM 智能体引入了一种自管理上下文系统,将智能体历史视为带有折叠、掩码和剪枝操作的索引对象,从而在减少令牌使用的同时保留未来依赖关系。
Memanto是一个专为AI开发环境打造的主动式工作记忆库,能在无API密钥和向量数据库的情况下,实现零延迟索引和高性能检索,支持Claude Code、Cursor等16+开发环境,在LongMemEval基准测试中达到89.8%的分数。
LeanCTX已更新,作为管理AI代理工具输出的网关,压缩大数据,擦除秘密,并通过MCP集成外部工具,以防止令牌爆炸。
Context Warp Drive 是一个面向LLM智能体的开源库,它使用确定性折叠来管理长上下文窗口,无需基于LLM的摘要,从而实现高效、缓存友好的智能体连续性。