context-compression

标签

Cards List
#context-compression

MORSE:基于反向评分的多上下文排序证据保留压缩方法

arXiv cs.CL ↗ · 5天前 缓存

本文介绍了MORSE,一种用于大型语言模型中证据保留上下文排序的压缩感知方法,能够提升证据保留和下游问答性能。

0 人收藏 0 人点赞
#context-compression

长期视野代理中记忆控制信号在行动前出现

arXiv cs.AI ↗ · 5天前 缓存

本文研究长期视野语言模型代理中的隐藏状态,揭示记忆压缩和召回需求在行动前被编码。提出PaMER框架,通过状态引导压缩和证据检索减少上下文消耗,同时保持任务性能。

0 人收藏 0 人点赞
#context-compression

为LLM推理压缩长上下文至答案对齐的记忆嵌入

arXiv cs.CL ↗ · 6天前 缓存

本文提出一种上下文与答案对齐的记忆压缩(CMC)框架,通过将长输入上下文压缩为紧凑的记忆嵌入,在不修改解码器权重的情况下降低LLM推理成本,显著提升性能和效率。

0 人收藏 0 人点赞
#context-compression

多轮编程代理中上下文压缩网关的经验性成本归属研究

arXiv cs.CL ↗ · 2026-09-22 缓存

本文实证分析了多轮编程代理中上下文压缩网关的成本节省情况,发现工具模式过滤提供固定令牌节省,而内容压缩呈二次方节省但可能被召回抵消,为成本优化提供了可操作的见解。

0 人收藏 0 人点赞
#context-compression

@FinanceYF5: 已经是2026年了,为什么Agents的上下文压缩还在依赖摘要提示?Jev找到了一种更直接的方法……

X AI KOLs Following ↗ · 2026-09-20

Jev为AI Agents引入了实时压缩技术,它对每个工具调用进行评分,以保留重要内容并直接删除无关数据,消除了基于模型的摘要需求,使上下文压缩更快、更轻量。

0 人收藏 0 人点赞
#context-compression

@yibie: Jev 生态系统 72 小时:从 46 到 160 Jev 将“判断”转化为一个足够廉价可直接在代码中调用的原语…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

在 72 小时内,Jev 生态系统从 46 个项目扩展到 160 个,重点包括上下文压缩、平台集成以及金融交易等新领域,同时围绕其新颖性和实现方式展开了辩论。

0 人收藏 0 人点赞
#context-compression

现在正确,以后不足:审计上下文压缩中的更新充分性

arXiv cs.LG ↗ · 2026-09-18 缓存

本文介绍了一种配对历史审计方法,用于评估AI记忆系统中上下文压缩的更新充分性,揭示了记忆现在回答正确但无法处理未来更新的故障。

0 人收藏 0 人点赞
#context-compression

超越静态RAG:一种用于商品GPU上高效长上下文推理的自适应三元度量路由框架

arXiv cs.LG ↗ · 2026-09-17 缓存

本文提出一种三元度量路由器,这是一种确定性框架,用于推理管道之间的自适应路由,以解决商品GPU上长上下文RAG中的压缩悖论,实现零OOM故障并提升性能。

0 人收藏 0 人点赞
#context-compression

检索增强生成中的归因-压缩前沿

arXiv cs.CL ↗ · 2026-09-15 缓存

本文研究了检索增强生成中上下文压缩与引用归因之间的权衡,评估了多种压缩方法,并揭示了答案质量与归因准确性之间的显著差距。

0 人收藏 0 人点赞
#context-compression

REVA:用于上下文高效RAG服务的可重用证据视图聚合

arXiv cs.LG ↗ · 2026-09-11 缓存

REVA是一个框架,通过挖掘历史注意力轨迹来创建可重用证据视图,用于上下文高效的RAG服务,在提高生成质量的同时,降低压缩开销和延迟。

0 人收藏 0 人点赞
#context-compression

FlexComp: 用于上下文中每种压缩比率的单一模型

arXiv cs.CL ↗ · 2026-09-11 缓存

FlexComp 是一个与方法无关的框架,它将压缩比率与训练和部署解耦,使得单一模型能够使用 Matryoshka 风格训练和基于每个输入的预算选择,在任何比率下压缩 LLM 上下文,以实现高效推理。

0 人收藏 0 人点赞
#context-compression

LatentPress: 上下文压缩超越文本和视觉

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

LatentPress介绍了一种将对话和文档上下文压缩为连续记忆令牌的方法,使冻结解码器无需文本重建即可直接读取,实现更高的压缩比并在长上下文任务上提升性能。

0 人收藏 0 人点赞
#context-compression

从检索上下文到运行时控制:基于边缘RAG的自适应压缩

arXiv cs.AI ↗ · 2026-08-21 缓存

本文提出了一种针对基于边缘的RAG系统的遥测信息驱动的自适应压缩方案,实验表明中间压缩可以将GPU能耗降低高达53.2%,且质量损失可忽略不计。

0 人收藏 0 人点赞
#context-compression

Ling 3.0 Tiny 成为 Hermes(Qwen 3.8 27B 作为主要模型)的优秀辅助模型

Reddit r/LocalLLaMA ↗ · 2026-08-20

一位用户分享了他们的设置,使用 Ling 3.0 Tiny 作为 Hermes(Qwen 3.8 27B)的辅助模型来处理简单任务,如上下文压缩和摘要生成,从而提高速度和效率,且不影响质量。

0 人收藏 0 人点赞
#context-compression

@LanLance24: Pi 发布了一篇博客详解他们的压缩机制设计,把上下文怎么膨胀、压缩怎么触发、缓存付出什么代价等进行了深入分析。

X AI KOLs Timeline ↗ · 2026-08-17 缓存

本文详细介绍了Pi编码代理的上下文压缩机制,分析了上下文膨胀原因、压缩触发条件以及缓存失效的代价,旨在优化长对话中的AI性能。

0 人收藏 0 人点赞
#context-compression

Explicit, Not Longer: What Makes Epistemic Stance Survive Memory Compression

arXiv cs.CL ↗ · 2026-08-10 缓存

This paper investigates how epistemic stance (qualifiers, attributions) survives memory compression in AI agent memory systems. It finds that making the stance explicit as a labelled field improves retention significantly, while merely lengthening the text does not.

0 人收藏 0 人点赞
#context-compression

Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

arXiv cs.LG ↗ · 2026-08-10 缓存

This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.

0 人收藏 0 人点赞
#context-compression

SeDeM:面向长上下文问答的隐状态记忆选择性解压缩

arXiv cs.CL ↗ · 2026-08-04 缓存

SeDeM 是一种选择性解压缩框架,它将长上下文的隐状态存储在紧凑的记忆库中,并且仅解压缩与查询相关的块以用于解码器条件化,从而在压缩基线之上提高了问答准确率和效率。

0 人收藏 0 人点赞
#context-compression

寻找贡献者 - 基于trie的内存高效LLM运行器

Reddit r/artificial ↗ · 2026-07-21 缓存

SALT 是一个开源工具,它使用关键词 trie 将长文档压缩成固定大小的纯文本提示,供 LLM 使用,以避免主题塌陷,并在令牌预算内高效选择信息丰富的句子。

0 人收藏 0 人点赞
#context-compression

虚构世界构建:基于分层上下文压缩与迭代审核的多智能体LLM协作

arXiv cs.AI ↗ · 2026-07-13 缓存

本文介绍了AutoWorldBuilder,一个用于自动化虚构世界构建的多智能体LLM系统。该系统通过分层上下文压缩、基于DAG的调度和迭代审核,解决了上下文爆炸、创意多样性和质量保证问题,实现了95%的成功率,并每个世界生成了56-103个自洽概念。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈