CoreMem: 对话代理中长期记忆的黎曼检索与Fisher引导蒸馏

arXiv cs.CL 论文

摘要

CoreMem提出了一种资源高效的边缘-云端内存架构,用于对话代理,采用基于Fisher-Rao度量的黎曼检索和Fisher引导的离散令牌蒸馏,在8 GB VRAM预算内实现了显著的准确性提升。

arXiv:2606.18406v1 公告类型:新 摘要:个性化对话代理需要持续的长期记忆,以在多轮会话中保持连贯的交互。然而,在消费级硬件(例如8 GB VRAM的边缘设备)上部署这些能力会带来严重的存储和计算瓶颈。现有系统通常依赖各向同性余弦相似度进行检索,并使用启发式规则进行上下文压缩。这些方法缺乏统一的理论基础,经常遭受高维检索中的中心化问题(hubness problem)以及压缩过程中的句法碎片化问题。为了解决这些限制,我们提出了CoreMem,一种资源高效的边缘-云端内存架构,其根本统一于信息几何。首先,黎曼检索用局部自适应的Fisher-Rao度量替代了余弦匹配,通过基于马氏距离的O(Ndr) Woodbury加速来有效惩罚中心记忆(hub memories),从而实现实时搜索。其次,Fisher引导的离散令牌蒸馏(FDTD)引入了一种层次化的句子到令牌压缩机制。它从Fisher信息迹中推导出敏感度得分,提供了原则性的压缩-KL权衡,并辅以显式的结构性句法保护。在LOCOMO和LongMemEval-S基准上的评估表明,CoreMem实现了显著的准确性提升,在开放域推理(+4.51个百分点)和时间推理(+4.17个百分点)上取得了可观增益。广泛的性能分析证实,CoreMem在严格的8 GB VRAM预算内无缝运行,成功弥合了资源受限的边缘设备与对理论支撑的终身记忆代理需求之间的差距。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:44

# 黎曼检索与费雪引导的蒸馏:对话智能体的长期记忆
来源: https://arxiv.org/html/2606.18406
陈嘉琪1 曾永强1 陈少深1 张奕健1 郑海涛1,2 马春霞3,4 周修腾4 1清华大学深圳国际研究生院 2鹏城实验室 3山东省分析测试中心,齐鲁工业大学,济南,中国 4道地药材质量保障与可持续利用国家重点实验室,北京,中国

###### 摘要

个性化对话智能体需要持续的长期记忆来维持跨会话的连贯交互。然而,在消费级硬件(例如,8 GB VRAM 的边缘设备)上部署这些能力会带来严重的内存和计算瓶颈。现有系统通常依赖于各向同性的余弦相似度进行检索,并使用启发式规则进行上下文压缩。这些方法缺乏统一的理论基础,常常在高维检索中遭受“中心点”问题(hubness problem),并在压缩过程中出现句法碎片化。为了克服这些限制,我们提出 CoreMem,一种资源高效的边缘-云记忆架构,其根本统一于信息几何。首先,黎曼检索用局部自适应的 Fisher-Rao 度量取代余弦匹配,通过 Mahalanobis 距离有效惩罚中心点记忆,并采用 O(Ndr) Woodbury 加速实现实时搜索。其次,费雪引导的离散词元蒸馏(FDTD)引入了分层的句子到词元压缩机制。它从 Fisher 信息迹中推导出灵敏度分数,提供一种有原则的压缩-KL 权衡,并增强以显式的结构句法保护。在 LOCOMO 和 LongMemEval-S 基准测试上,CoreMem 取得了显著的准确率提升,在开放域推理(+4.51 百分点)和时间推理(+4.17 百分点)上获得较大增益。广泛的性能分析证实,CoreMem 可在严格的 8 GB VRAM 预算内无缝运行,成功弥合了资源受限的边缘设备与对理论有基础、终身记忆智能体的需求之间的鸿沟。

CoreMem:对话智能体长期记忆的黎曼检索与费雪引导蒸馏

## 1 引言

大型语言模型(LLM)引发了对话式 AI 的范式转变,使智能体能够充当个人助理、治疗师和持续的伴侣。随着这些智能体从云端专用部署转向消费级设备——例如配备 8–16 GB RAM 的笔记本电脑和 6–12 GB VRAM 的边缘 GPU——长期记忆的高效管理已成为关键瓶颈。用户自然期望智能体能够在数十次会话中保持连贯的人格并回忆事实。然而,主流的行业做法——“上下文填充”(context stuffing),即贪婪地将所有历史交互串联到提示中——在经济上不可持续,在数学上也非最优。除了导致 API 成本随对话长度线性膨胀外,过多的上下文还会加剧位置偏差和“中间丢失”的幻觉现象(Liu 等,2024 (https://arxiv.org/html/2606.18406#bib.bib2);Hsieh 等,2024 (https://arxiv.org/html/2606.18406#bib.bib10))。

消费级约束。考虑一个典型的边缘-云部署:用户操作一块 NVIDIA RTX 4060 笔记本电脑 GPU(8 GB VRAM),运行本地嵌入模型,并依赖云端 API(例如 GPT-4o-mini;OpenAI,2023 (https://arxiv.org/html/2606.18406#bib.bib47))进行最终生成。一个具有竞争力的嵌入模型本身就需要大约 3 GB 的显存。这给记忆索引系统、本地上下文压缩器和操作系统开销留下了极为微薄的空间。现有的主流记忆框架——例如 MemGPT(Packer 等,2023 (https://arxiv.org/html/2606.18406#bib.bib31))、MemoryBank(Zhong 等,2024 (https://arxiv.org/html/2606.18406#bib.bib32))和 Mem0(Chhikara 等,2025 (https://arxiv.org/html/2606.18406#bib.bib33))——主要基于服务器级假设进行设计,缺乏这种资源受限场景所需的算法节俭性。

除了硬件限制,云端 API 调用的经济成本与提示长度呈线性增长。一个典型的长时间对话会话,历史上下文包含 1,500 个词元,每天查询 50 次,按 GPT-4o-mini 费率计算,每天大约需要 0.75 美元。一个月下来,每位用户累计达到 22.50 美元——这对于消费级产品来说是难以承受的成本。通过在传输前在本地压缩上下文,CoreMem 大幅减少了传输到云端 LLM 的词元数量,直接转化为成比例的 API 成本节省(§5.6 (https://arxiv.org/html/2606.18406#S5.SS6))。这些约束要求一种记忆架构同时满足以下要求:对显存友好(在 6 GB 内运行)、对时间友好(每次查询低于 100 毫秒)、以及对词元友好(压缩提示 20–30%)。这三个迫切需求驱动我们追求一个理论上有基础、资源高效的记忆系统。

当前架构在严格预算下存在三个局限。首先,各向同性的余弦检索容易受到“中心点”问题的影响:一小部分“中心点”记忆主导了近邻列表,淹没了在几何上处于边缘但在语义上关键的事实(Radovanović 等,2010 (https://arxiv.org/html/2606.18406#bib.bib38))。其次,压缩算法缺乏理论保证;启发式剪枝不提供 KL 散度边界,使得部署成为试错的赌注(Pan 等,2024 (https://arxiv.org/html/2606.18406#bib.bib28);Li 等,2023a (https://arxiv.org/html/2606.18406#bib.bib29))。第三,检索和压缩以不连贯的目标进行优化,导致级联失败:检索到的事实的结构连接词(例如“因为”)在压缩过程中丢失。

参见图注 图 1:CoreMem 边缘-云混合流水线。本地边缘运行一个对显存友好的嵌入/检索栈、一个对时间友好的黎曼搜索和 FDTD 压缩器,并将仅对词元友好的蒸馏上下文传输到云端 LLM,将 API 成本降低约 20%。为了弥合这些差距,我们提出 CoreMem(Curvature-oriented Riemannian Edge Memory,面向曲率的黎曼边缘记忆,图 1 (https://arxiv.org/html/2606.18406#S1.F1)),一种通过信息几何(Amari,2016 (https://arxiv.org/html/2606.18406#bib.bib39))优雅统一的边缘-云混合记忆架构。CoreMem 不是将检索和压缩视为不连贯的启发式方法,而是通过统计流形的几何视角来看待两者:检索被形式化为对空间扭曲的嵌入流形(使用逆协方差)进行距离测量,而压缩则通过测量损失景观的曲率(使用对角 Fisher 信息矩阵)来评估词元的重要性。在 CoreMem 流水线中,本地小语言模型(SLM)检索并蒸馏历史上下文,仅将严格必要、高度密集的信息传输到云端 LLM。

我们的主要贡献总结如下:

1. 1.我们引入了黎曼检索(§3.2 (https://arxiv.org/html/2606.18406#S3.SS2)),将记忆嵌入视为统计流形上的点。通过采用局部自适应的 Fisher-Rao 度量(使用 Mahalanobis 距离,并采用 O(Ndr) Woodbury 加速),我们从根本上缓解了中心点问题。
2. 2.我们推导了费雪引导的离散词元蒸馏(FDTD;§3.3 (https://arxiv.org/html/2606.18406#S3.SS3)),一种分层的句子到词元压缩算法。它利用 Fisher 信息迹提供有原则的压缩-KL 权衡,并与显式的结构句法保护相集成。
3. 3.我们提供了全面的压力测试和模块消融实验(§5 (https://arxiv.org/html/2606.18406#S5)),以验证黎曼检索和 FDTD 压缩在极端词元预算和结构配置下的鲁棒性,揭示了黎曼度量和余弦度量对不同推理拓扑具有互补优势。
4. 4.在 LOCOMO 和 LongMemEval-S 上的评估展示了显著的准确率提升,在开放域推理(+4.51 百分点)和时间推理(+4.17 百分点)上取得决定性增益,同时保持在 8 GB VRAM 上限内。

## 2 相关工作

#### 智能体记忆系统。

开创性框架如 MemGPT(Packer 等,2023 (https://arxiv.org/html/2606.18406#bib.bib31))在 RAM 和磁盘之间分页上下文以模拟操作系统。MemoryBank(Zhong 等,2024 (https://arxiv.org/html/2606.18406#bib.bib32))通过艾宾浩斯遗忘曲线模拟人类遗忘,而最近的系统如 Mem0(Chhikara 等,2025 (https://arxiv.org/html/2606.18406#bib.bib33))、MemoryOS(Kang 等,2025 (https://arxiv.org/html/2606.18406#bib.bib35))、CarMem(Kirmayr 等,2025 (https://arxiv.org/html/2606.18406#bib.bib36))和 A-mem(Xu 等,2026 (https://arxiv.org/html/2606.18406#bib.bib34))采用向量搜索结合分段分页或知识图谱。然而,这些系统天生针对服务器级硬件。它们没有采用信息几何原理或推导有理论边界的压缩来优化边缘设备的严格计算上限。

#### 上下文压缩。

现有的蒸馏技术通常依赖于辅助小模型或启发式规则。LLMLingua2(Pan 等,2024 (https://arxiv.org/html/2606.18406#bib.bib28))和 LongLLMLingua(Jiang 等,2024 (https://arxiv.org/html/2606.18406#bib.bib1))将词元剪枝视为词元级分类任务,而 SelectiveContext(Li 等,2023a (https://arxiv.org/html/2606.18406#bib.bib29))和 C3(Liu and Qiu,2025 (https://arxiv.org/html/2606.18406#bib.bib23))基于自信息或上下文级联压缩来筛选句子。AutoCompressor(Chevalier 等,2023 (https://arxiv.org/html/2606.18406#bib.bib8))和 GIST(Mu 等,2023 (https://arxiv.org/html/2606.18406#bib.bib7))学习软提示表示。Li 等人(2025 (https://arxiv.org/html/2606.18406#bib.bib11))近期的一项综述列举了超过二十种提示压缩方法,但指出没有一种提供关于语义损失的显式理论边界。我们的 FDTD 受神经网络剪枝理论(Molchanov 等,2017 (https://arxiv.org/html/2606.18406#bib.bib41);Kunstner 等,2019 (https://arxiv.org/html/2606.18406#bib.bib3))启发,直接从对角 Fisher 信息矩阵推导灵敏度,从而得到数学上有原则的压缩-KL 权衡。

#### NLP 中的黎曼度量。

信息几何(Amari,2016 (https://arxiv.org/html/2606.18406#bib.bib39);Amari and Nagaoka,2000 (https://arxiv.org/html/2606.18406#bib.bib6))严格定义了统计流形,但由于协方差求逆的 O(d³) 复杂度令人望而却步,其应用于实时 NLP 检索仍然稀少。Bhardwaj(2026 (https://arxiv.org/html/2606.18406#bib.bib24))的并发工作探索了严格对角高斯流形上的 Fisher-Rao 距离。相比之下,我们的方法通过对角协方差上应用低秩 SVD 校正来捕捉复杂的跨维度相关性,并通过 Woodbury 加速进行激进优化以实现近乎即时的搜索。除了信息几何度量,并发工作还通过词元感知的嵌入增强实现细粒度词汇-语义对齐来改进稠密检索(Zhan 等,2025 (https://arxiv.org/html/2606.18406#bib.bib49))。

#### 与先前工作的区别。

表 1 (https://arxiv.org/html/2606.18406#S2.T1) 突出了 CoreMem 与代表性基线之间的关键差异。与针对服务器级硬件设计的 MemGPT 和 MemoryBank 不同,CoreMem 针对具有严格 8 GB VRAM 约束的消费级边缘设备。与启发式压缩器(LLMLingua2、SelectiveContext)不同,FDTD 通过 Fisher 信息提供有原则的 KL 散度边界。与采用严格截断的纯余弦检索(NaiveRAG、Mem0)不同,CoreMem 引入了局部自适应的黎曼度量来缓解中心点问题。据我们所知,CoreMem 是第一个在单个信息几何框架下统一检索和压缩,同时在边缘硬件上保持实时延迟的系统。

表 1:与代表性基线的高级比较。Edge = 可在 8 GB VRAM 消费硬件上运行。

## 3 方法论

### 3.1 问题形式化

对话智能体维护一个历史记忆集 M={m1,...,mN},其对应的连续表示定义为 H=[h1,...,hN]⊤∈RN×d。给定一个用户查询 q 嵌入为 q∈Rd,智能体执行三个阶段流水线:(1) 从 M 中检索 top-k 相关记忆以形成原始上下文池 X;(2) 将 X 蒸馏为紧凑表示 X~,满足严格的词元预算 B;(3) 通过基于云端的 LLM 生成最终答案 a∼pθ(a∣X~,q)。我们的总体目标是在严格限制本地计算开销和云端 API 词元消耗的同时,最大化生成的事实准确性。

### 3.2 黎曼检索

#### 动机。

余弦相似度的普遍使用 sim(q,h)=q⊤h‖q‖‖h‖ 将所有潜在维度视为各向同性的。在高维空间(d≥1024)中,这种各向同性会导致严重的“中心点”问题:一小部分嵌入向量不可预测地成为大量查询的最近邻,而与真实的语义相关性无关(Radovanović 等,2010 (https://arxiv.org/html/2606.18406#bib.bib38))。如图 2 (https://arxiv.org/html/2606.18406#S3.F2) 的可视化证实,我们需要一种几何感知的度量,能够惩罚密集的中心点区域并拉伸塌缩的维度,以浮现处于边缘但关键的尾部记忆。

参见图注 图 2:中心点情况下的余弦与 Fisher-Rao 黎曼几何对比。图 (a) 各向同性余弦:少量大型中心点记忆紧密围绕在查询附近并从多个方向吸收最近邻流量(汇聚的箭头),而较小的尾部记忆位于虚线余弦边界之外且明显不可达——这是典型的中心点机制。图 (b) 局部自适应 Fisher-Rao:细长的度量椭圆及其两个特征向量箭头描绘了局部 Mahalanobis 张量;拉伸的流形将相同的中心点几何推出邻域,并将之前处于边缘的尾部记忆拉入其中,使其恢复为可行的近邻。

#### 局部自适应协方差与 Woodbury 加速。

我们通过 Fisher-Rao 度量来衡量语义距离,在高斯假设下,该度量简化为 Mahalanobis 距离:每个嵌入被视为一个高斯的均值,其协方差从数据中估计,使得 Fisher 信息矩阵等于逆协方差。在将嵌入 L2 归一化到单位超球面后,我们计算每个维度上的经验方差:σ2=Var({hi}i=1N)。

为了构建一个可逆且稳定的局部协方差矩阵,我们将其建模为 Σ≈UrMrUr⊤+D,其中 D=diag(σ2+λ)。此

相似文章

DuoMem: 面向设备端能力型内存代理的双空间蒸馏框架

Hugging Face Daily Papers

DuoMem 是一种双空间蒸馏框架,通过上下文空间蒸馏和参数空间蒸馏,将大型语言模型的过程性问题解决能力迁移至紧凑的学生模型,以极少的额外参数实现高性能并提升推理速度。该框架在 ALFWorld 上,将 4B 参数规模模型的任务成功率从 4.3% 提升至 77.9%。