@zostaff:这篇论文彻底改变了我对会话压缩的看法:建模DAG -> 快照 -> 分支 -> 修剪结构…
摘要
一篇论文提出了一种结构化的会话压缩方法,将聊天历史建模为带有快照和分支的DAG,在保留语义的同时修剪冗余,在编码会话中平均削减20%的token。
查看缓存全文
缓存时间: 2026/08/05 16:26
这篇论文彻底改变了我对会话压缩(session compaction)的看法:
将 DAG 建模 -> 快照 -> 分支 -> 结构性修剪 -> 逐字保留
以下是五步蓝图:
建模 DAG:会话历史并非线性日志,而是版本化状态——一个包含快照和分支的有向无环图。
快照:累积的理解、架构图谱、权衡取舍、代码库约定,都以命名状态的形式被捕获,而不是在窗口溢出时被淹没丢失。
分支:快照可在独立的并行会话中复用,上下文可被分叉(fork),并保留谱系追踪。
结构性修剪:一种三遍算法,剔除机械性冗余、原始工具输出、base64 图片、元数据,而非意义本身。
逐字保留:每条用户消息和助手回复都原封不动地保留,修剪在结构上是无损的。
核心洞察在于:原生自动压缩(autocompaction)会把会话中累积状态的 98% 压成一段简短的摘要,而整个会话过程中获得的每一点理解都随之丢失。
在 76 个真实编码会话中,该方法平均削减了 20% 的 token,在重度会话中最高可达 86%,而在提示缓存(prompt caching)下,混合型会话在 10 轮之内即可达到盈亏平衡。
先读这个,再看下面的文章。
相似文章
@zostaff: 这篇论文彻底改变了我对自我演化代码库的看法:Backlog -> Ideate -> Triage -> Execute -> Poli…
这篇论文提出了一个利用LLM实现自我演化代码库的六阶段蓝图,强调向规范(specification)而非指标收敛。
@omarsar0: // The Efficiency Frontier // 关于上下文管理的有趣论文。随着代理在多次交互中重复使用相同的文档和历史记录……
本文介绍了The Efficiency Frontier,一个用于LLM上下文管理成本-性能优化的统一框架,它将上下文策略选择建模为一个部署感知的优化问题,通过摊销内存压缩,与全上下文提示相比,实现了25%的token使用量减少和超过50%的token成本降低。
@zostaff: 这篇论文完全改变了我对自我改进智能体的看法:初始化 -> 运行 -> 分析 -> 分支 -> 更新…
这篇论文提出了一种自我改进智能体的新颖蓝图,通过元智能体和反馈智能体结合支架编辑和权重训练,在AlphaFold的CUDA内核上实现了14倍加速。
我的最后两篇论文:基于LLM的实体中带有时间戳日志的连续性与涌现人格,以及记忆如何减少令牌消耗和开发人员时间
作者介绍了这两篇论文,探讨了基于LLM的实体中带有时间戳日志的连续性与涌现人格,以及记忆如何减少令牌消耗和开发人员时间。
超越压缩:面向长周期智能体的结构化上下文驱逐
介绍了上下文窗口生命周期(CWL),这是一种面向长周期LLM智能体的结构化上下文驱逐方案,通过基于依赖图驱逐内容来维持有效无界的工作视野,避免了基于摘要的压缩和最近截断的局限性。