标签
本文介绍了MORSE,一种用于大型语言模型中证据保留上下文排序的压缩感知方法,能够提升证据保留和下游问答性能。
本文研究长期视野语言模型代理中的隐藏状态,揭示记忆压缩和召回需求在行动前被编码。提出PaMER框架,通过状态引导压缩和证据检索减少上下文消耗,同时保持任务性能。
本文提出一种上下文与答案对齐的记忆压缩(CMC)框架,通过将长输入上下文压缩为紧凑的记忆嵌入,在不修改解码器权重的情况下降低LLM推理成本,显著提升性能和效率。
本文实证分析了多轮编程代理中上下文压缩网关的成本节省情况,发现工具模式过滤提供固定令牌节省,而内容压缩呈二次方节省但可能被召回抵消,为成本优化提供了可操作的见解。
Jev为AI Agents引入了实时压缩技术,它对每个工具调用进行评分,以保留重要内容并直接删除无关数据,消除了基于模型的摘要需求,使上下文压缩更快、更轻量。
在 72 小时内,Jev 生态系统从 46 个项目扩展到 160 个,重点包括上下文压缩、平台集成以及金融交易等新领域,同时围绕其新颖性和实现方式展开了辩论。
本文介绍了一种配对历史审计方法,用于评估AI记忆系统中上下文压缩的更新充分性,揭示了记忆现在回答正确但无法处理未来更新的故障。
本文提出一种三元度量路由器,这是一种确定性框架,用于推理管道之间的自适应路由,以解决商品GPU上长上下文RAG中的压缩悖论,实现零OOM故障并提升性能。
本文研究了检索增强生成中上下文压缩与引用归因之间的权衡,评估了多种压缩方法,并揭示了答案质量与归因准确性之间的显著差距。
REVA是一个框架,通过挖掘历史注意力轨迹来创建可重用证据视图,用于上下文高效的RAG服务,在提高生成质量的同时,降低压缩开销和延迟。
FlexComp 是一个与方法无关的框架,它将压缩比率与训练和部署解耦,使得单一模型能够使用 Matryoshka 风格训练和基于每个输入的预算选择,在任何比率下压缩 LLM 上下文,以实现高效推理。
LatentPress介绍了一种将对话和文档上下文压缩为连续记忆令牌的方法,使冻结解码器无需文本重建即可直接读取,实现更高的压缩比并在长上下文任务上提升性能。
本文提出了一种针对基于边缘的RAG系统的遥测信息驱动的自适应压缩方案,实验表明中间压缩可以将GPU能耗降低高达53.2%,且质量损失可忽略不计。
一位用户分享了他们的设置,使用 Ling 3.0 Tiny 作为 Hermes(Qwen 3.8 27B)的辅助模型来处理简单任务,如上下文压缩和摘要生成,从而提高速度和效率,且不影响质量。
本文详细介绍了Pi编码代理的上下文压缩机制,分析了上下文膨胀原因、压缩触发条件以及缓存失效的代价,旨在优化长对话中的AI性能。
This paper investigates how epistemic stance (qualifiers, attributions) survives memory compression in AI agent memory systems. It finds that making the stance explicit as a labelled field improves retention significantly, while merely lengthening the text does not.
This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.
SeDeM 是一种选择性解压缩框架,它将长上下文的隐状态存储在紧凑的记忆库中,并且仅解压缩与查询相关的块以用于解码器条件化,从而在压缩基线之上提高了问答准确率和效率。
SALT 是一个开源工具,它使用关键词 trie 将长文档压缩成固定大小的纯文本提示,供 LLM 使用,以避免主题塌陷,并在令牌预算内高效选择信息丰富的句子。
本文介绍了AutoWorldBuilder,一个用于自动化虚构世界构建的多智能体LLM系统。该系统通过分层上下文压缩、基于DAG的调度和迭代审核,解决了上下文爆炸、创意多样性和质量保证问题,实现了95%的成功率,并每个世界生成了56-103个自洽概念。