为长期运行的LLM代理构建的令牌预算感知上下文编排

Reddit r/ArtificialInteligence 工具

摘要

ContextOS是一个开源的令牌预算感知上下文编排层,专为长期LLM代理设计,使用混合检索和确定性规划来为上下文选择记忆,并提供执行轨迹以便检查。

我构建了ContextOS,这是一个开源的、令牌预算感知的上下文编排层,专为长期运行的LLM代理设计。其核心思想是,检索和上下文选择是不同的问题。ContextOS采用混合检索(稠密 + BM25)、RRF融合、交叉编码器重排序以及确定性令牌预算感知规划,来决定哪些记忆真正进入模型的上下文。它还为每个决策记录执行轨迹,以便您可以检查为什么某个记忆被选中或拒绝、它在每个阶段的排名如何,以及它消耗了多少上下文预算。我构建了一个评估工具和一个交互式演示来可视化整个流程。GitHub: https://github.com/ayeangad/contextos
查看原文

相似文章

TokenPilot:面向LLM代理的缓存高效上下文管理

Hugging Face Daily Papers

TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。

面向长时程LLM推理的上下文回收

arXiv cs.CL

本文介绍了ContextForge,一种层次化内存架构,将LLM上下文窗口视为可回收工作空间,在长时程任务上实现了显著的令牌和速度改进,同时在拥有2.76亿行的企业基准上保持了准确性。