@zostaff:这篇论文彻底改变了我对会话压缩的看法:建模DAG -> 快照 -> 分支 -> 修剪结构…

X AI KOLs Timeline 论文

摘要

一篇论文提出了一种结构化的会话压缩方法,将聊天历史建模为带有快照和分支的DAG,在保留语义的同时修剪冗余,在编码会话中平均削减20%的token。

这篇论文彻底改变了我对会话压缩的思考: 建模DAG -> 快照 -> 分支 -> 结构化修剪 -> 逐字保留 以下是5步蓝图: 建模DAG:会话历史不是线性日志,而是版本控制的状态,是一个带有快照和分支的有向无环图。 快照:累积的理解、架构图、权衡决策、代码库约定,被捕获为命名状态,而不是在窗口溢出时被淹没。 分支:快照在独立的并行会话间复用,上下文分支派生,并保留谱系追踪。 结构化修剪:一种三遍算法去除机械性冗余、原始工具输出、base64图片、元数据,而不是含义。 逐字保留:每条用户消息和助手回复都一字不差地保留,修剪在结构上是无损的。 关键洞察:原生自动压缩会将会话累积状态的98%压缩成一段简短摘要,而会话中获得的每一点理解都会丢失。 在76个真实编码会话中,这平均削减了20%的token,重度会话最高削减86%,而混合会话在提示缓存下10轮内即可持平。 读读这个,然后看看下面的文章。
查看原文
查看缓存全文

缓存时间: 2026/08/05 16:26

这篇论文彻底改变了我对会话压缩(session compaction)的看法:

将 DAG 建模 -> 快照 -> 分支 -> 结构性修剪 -> 逐字保留

以下是五步蓝图:

建模 DAG:会话历史并非线性日志,而是版本化状态——一个包含快照和分支的有向无环图。

快照:累积的理解、架构图谱、权衡取舍、代码库约定,都以命名状态的形式被捕获,而不是在窗口溢出时被淹没丢失。

分支:快照可在独立的并行会话中复用,上下文可被分叉(fork),并保留谱系追踪。

结构性修剪:一种三遍算法,剔除机械性冗余、原始工具输出、base64 图片、元数据,而非意义本身。

逐字保留:每条用户消息和助手回复都原封不动地保留,修剪在结构上是无损的。

核心洞察在于:原生自动压缩(autocompaction)会把会话中累积状态的 98% 压成一段简短的摘要,而整个会话过程中获得的每一点理解都随之丢失。

在 76 个真实编码会话中,该方法平均削减了 20% 的 token,在重度会话中最高可达 86%,而在提示缓存(prompt caching)下,混合型会话在 10 轮之内即可达到盈亏平衡。

先读这个,再看下面的文章。

相似文章

有人在研究对话压缩吗?

Reddit r/LocalLLaMA

作者讨论了在其聊天应用'harness'中使用递归摘要来管理上下文,但观察到在许多消息后Qwen Flash Next模型性能下降,质疑对话压缩是否会影响模型连贯性。