为长期运行的LLM代理构建的令牌预算感知上下文编排
摘要
ContextOS是一个开源的令牌预算感知上下文编排层,专为长期LLM代理设计,使用混合检索和确定性规划来为上下文选择记忆,并提供执行轨迹以便检查。
我构建了ContextOS,这是一个开源的、令牌预算感知的上下文编排层,专为长期运行的LLM代理设计。其核心思想是,检索和上下文选择是不同的问题。ContextOS采用混合检索(稠密 + BM25)、RRF融合、交叉编码器重排序以及确定性令牌预算感知规划,来决定哪些记忆真正进入模型的上下文。它还为每个决策记录执行轨迹,以便您可以检查为什么某个记忆被选中或拒绝、它在每个阶段的排名如何,以及它消耗了多少上下文预算。我构建了一个评估工具和一个交互式演示来可视化整个流程。GitHub: https://github.com/ayeangad/contextos
相似文章
TokenPilot:面向LLM代理的缓存高效上下文管理
TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。
@omarsar0: // The Efficiency Frontier // 关于上下文管理的有趣论文。随着代理在多次交互中重复使用相同的文档和历史记录……
本文介绍了The Efficiency Frontier,一个用于LLM上下文管理成本-性能优化的统一框架,它将上下文策略选择建模为一个部署感知的优化问题,通过摊销内存压缩,与全上下文提示相比,实现了25%的token使用量减少和超过50%的token成本降低。
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。
面向长时程LLM推理的上下文回收
本文介绍了ContextForge,一种层次化内存架构,将LLM上下文窗口视为可回收工作空间,在长时程任务上实现了显著的令牌和速度改进,同时在拥有2.76亿行的企业基准上保持了准确性。
令牌预算:63起LLM智能体预算超支事件的实证目录,以及基于仿射类型Rust缓解方案的案例研究
本文呈现了来自21个编排框架的63起经确认的LLM智能体预算超支事件的实证目录,按故障分类法组织,并介绍了一个使用仿射类型所有权的Rust crate,在编译时而非运行时防止令牌/成本预算违规。