用户侧记忆中的基底不对称性:一个诊断框架

arXiv cs.CL 论文

摘要

本文介绍了一个针对LLMs用户侧记忆的诊断框架,表明个性化因素分解为行为一致性、事实存在和事实缺失。它证明了没有任何单一方法(例如LoRA vs RAG)在所有三个轴上均表现出色,并强调了参数化用户记忆的对齐税。

arXiv:2606.11712v1 Announce Type: new 摘要:LLMs中的用户侧记忆通常被评分为单一的“个性化”能力:给定用户历史,输出是否更具用户感知?我们表明这一聚合指标隐藏了方向相反的失败。记忆至少分解为三个正交轴——行为一致性(风格、语气)、事实存在(回忆历史中的事实)和事实缺失(当事实不存在时放弃回答)——并且没有单一基底能在所有三个轴上获胜。在受控的50用户合成语料库和真实数据探针(LaMP-3)上,对比每个用户的gamma-LoRA(一个在每个用户历史上训练的小型LoRA适配器;gamma表示按用户而非按任务)与BGE-large密集Top-K检索,我们发现gamma-LoRA在行为风格上明显获胜,而RAG在事实缺失上明显获胜——并且注意力层21-35中相同的查询投影单元因果性地承载了这两种相反方向的效应(将这些LoRA权重归零使缺失探测TPR提升33个百分点,并使存在探测TPR下降20个百分点)。在更经过大量RLHF微调的Llama-3.1-8B-Instruct上,不对称性增强而非修复:参数化记忆的行为优势崩溃,而其对检索的缺失校准缺陷扩大——这是参数化用户记忆的对齐税。在真实数据LaMP-3上,gamma-LoRA表现不如多数基线;一次9种条件的缓解扫描将其诊断为指令跟随崩溃,而非基底故障(9x2交叉乘积显示评估时的{1..5} logit掩码能将每个配方的main_acc驱动至>=0.995),且最佳训练时修复在Llama上逐位复现。最后,基底选择路由是问题分类,而非校准:仅基于问题文本的110M参数DistilBERT击败了所有基于logit的路由器。我们贡献了诊断框架、已诊断的真实数据负面结果、对齐税复现,以及路由即分类这一发现。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:41

# 用户侧记忆中的基础结构不对称性:一个诊断框架
**来源:** https://arxiv.org/html/2606.11712

###### 摘要
大型语言模型中的用户侧记忆通常被量化为单一的"个性化"能力——给定用户历史,输出是否更具用户意识?我们证明,这种聚合指标隐藏了方向相反的失败模式。记忆至少可分解为三个正交轴——**行为一致性**(风格、语态)、**事实存在性**(回忆历史中的事实)和**事实缺失性**(当事实不存在时放弃回答)——并且没有单一基础结构能在这三个维度上同时胜出。通过在一个受控的50用户合成语料库和一个真实数据探测(Salemi等人,2024 (https://arxiv.org/html/2606.11712#bib.bib29))上比较每个用户的γ\-LoRA(在每个用户历史上训练的小型LoRA适配器;γ表示按用户而非按任务)与BGE-large密集top-K检索,我们发现γ\-LoRA在行为风格上决定性胜出,而RAG在事实缺失性上决定性胜出——并且注意力层21–35中相同的查询投影单元以**相反**方向因果承重这两种效应(将这些LoRA权重归零会使缺失探测的真阳性率上升+33个百分点,同时使存在探测的TPR下降20个百分点)。在更重度RLHF调优的Llama-3.1-8B-Instruct上,这种不对称性加强而非愈合:参数化记忆的行为优势崩溃,而其对检索的缺失校准差距扩大——这是对参数化用户记忆的**对齐税**。在真实数据LaMP-3上,γ\-LoRA表现低于多数基线;一个9条件缓解扫描诊断出这是指令跟随崩溃,而非基础结构失败(一个9×2缓解交叉乘积表明,评估时的{1..5} logit掩码使每个训练方案的主准确率达到≥0.995——方案选择无法逃脱崩溃,而残差探测2的上限0.605–0.660是任务结构性的,非方案可调),且最佳训练时修复在Llama上比特级复制。最后,基础结构选择路由是**问题分类**,而非校准:一个110M参数的DistilBERT仅凭问题文本就击败了所有基于logit的路由器。我们贡献了诊断框架、诊断出的真实数据负结果、对齐税复现结果,以及路由即分类的发现。

## 1 引言

### 1.1 聚合数字隐藏了方向相反的失败模式
大型语言模型中的个性化通常被量化为单一数字:混合基准上的准确率、相对于无历史基线的胜率、相对于"无用户意识"控制的"用户意识"增量。基准测试(LaMP、PERSOMA、UQABench)报告顶层指标,这些指标在单一旗帜下聚合了异构任务类型——风格模仿、事实回忆、偏好预测、分类。单一数字的框架有其隐藏成本。我们证明,在一个受控的合成人物语料库和真实的LaMP-3上,**在相同用户历史上训练的相同基础结构,可以在同一50个用户上同时以+47分赢得"个性化"的一个组成部分,并以-90分输掉另一个组成部分**。将这些聚合为一个分数并不能揭示该领域需要做出的基础结构层面决策;反而掩盖了它。

参见图注

图1:基础结构-轴不对称性预告。相同的50个人物、相同的用户历史:γ\-LoRA以+47pp赢得行为风格;RAG以+90pp赢得事实缺失性。没有单一基础结构能同时赢得两个轴;聚合成单一的"个性化"分数隐藏了这种方向相反的失败模式。

具体来说,用户侧记忆至少是**两个**问题,而解决其中一个问题的基础结构会在另一个问题上以相反方向失败。第一个是**行为一致性**——让模型生成看起来、听起来和偏好与特定用户一致的文本。风格、语态、语域、词汇习惯、话题偏好、观点先验。这是一个**分布性**问题:模型的输出分布应向用户的分布偏移。这是**参数化**记忆的天然目标——梯度调优的权重(LoRA、前缀调优、人物条件适配器)整体移动模型的分布。第二个是**事实校准**——当答案在用户历史中时回答关于用户生活的问题,**并在答案不在时弃权**。"她2019年搬到了哪个城市?"如果相关事实出现在历史中,应该可以回答;"她曾在柏林住过吗?"如果未出现此类事实,应该回答**否**。这是一个**符号性**问题:必须检索特定的标记(城市、日期),或者必须检测到缺乏证据。这是**检索增强**记忆的天然目标——对历史块进行向量搜索、top-K上下文注入、弃权提示。这些基础结构不可互换。我们证明,γ\-LoRA(*参数化按用户记忆*:一个小型LoRA适配器,秩128,以仅助手损失掩码在每个用户历史上训练20个epoch;γ前缀表示按用户,而非按任务)和BGE+top-K文本RAG(*检索*:BGE-large-en-v1.5密集嵌入,top-K=5个用户历史块,带固定弃权子句)在相同用户历史上训练,在彼此的自然问题上以相反方向失败:

- • 在**风格**上(保留用户续写的下一个token对数似然,50位写作提示作者),γ\-LoRA相对于无历史基线改善+0.473 nat/tok,而RAG仅改善+0.060 nat/tok(基本不起作用)。结构模式是一致的:γ\-LoRA在50/50个人物和240/250条记录上击败RAG。
- • 在**缺失性**上(针对50个合成人物的12个受控是/否探测的真实阳性率,探测分为"历史中存在的事实"和"历史中缺失的事实"),γ\-LoRA的缺失TPR为8.7%(它编造一个合理答案而非弃权),而RAG的缺失TPR为99.0%(当检索未返回相关块时,弃权提示可靠触发)。γ\-LoRA在存在事实回忆上胜出(56.3% vs 35.3%)——完全相同的不对称性。单一基础结构无法赢得两个探测。每种基础结构各自拥有一个并输掉另一个。我们称之为**基础结构不对称性**,并认为这是用户侧记忆的正确分析单位。

### 1.2 本文贡献
1. 1. **用户侧记忆的诊断框架**,包含三个探测(风格对数似然、事实存在/缺失TPR、真实数据迁移),跨越四个参考配置。这些探测将顶层准确率分解为真正重要的轴;单一数字无法区分行为失败、校准失败和指令跟随失败。
2. 2. **基础结构不对称性发现**:参数化记忆赢得行为性,检索记忆赢得缺失校准,在相同训练历史、相同规模下,带有预注册的证伪器和基础结构控制的比较。
3. 3. **因果机制**:在每个任务上,γ\-LoRA在注意力查询投影层21–35中的Frobenius质量(我们称之为**顶部带**)与存在TPR(r=+0.41)和缺失TPR(r=-0.49)呈相反方向相关;在n=50处将该带归零使缺失TPR上升33个百分点,存在TPR下降20个百分点。描述性带在Llama-3.1-8B上复现(查询/输出投影上的质量约为键/值投影的2倍);Llama因果干预留作未来工作。
4. 4. **真实数据迁移上的诊断负结果**:在LaMP-3崩溃上的9×2缓解交叉乘积在§4.3中分解。评估时的logit掩码{1..5}在8个训练方案中的每一个上都驱动精确匹配评分准确率达到≥0.995(跨交叉乘积平均0.998),将差距隔离为指令跟随崩溃而非基础结构失败;残差成对探测上限聚集在[0.605, 0.660]范围内,σ=0.018,且与方案无关——这是LaMP-3任务结构(4个上下文偏好对)的属性,而非训练方案的属性。两种修复都在Llama-3.1-8B上跨模型复现:评估时掩码给出主准确率0.995(Qwen上为1.000),最佳训练时修复(KL锚点)比特级相同(探测2 0.655 = 0.655;r=0.78,p<0.0001)。我们将§4.3的诚实负结果转化为**规范性负结果**:基础结构未损坏,且输出约束修复跨基础模型和方案迁移。
5. 5. **参数化用户记忆上的对齐税**:在更重度RLHF/指令调优的Llama-3.1-8B-Instruct上复现§4.1-§4.2,基础结构不对称性**放大**而非愈合。行为风格优势崩溃为噪声(Δ+0.413→+0.003 nat/tok),而基础结构控制的缺失差距**扩大**33pp(+45.7→+79)。定性模式跨模型规模迁移;具体大小是后训练税特定的。我们预注册了预测"*更重的后训练→更大的校准差距,更小的风格差距*",用于未来更大模型上的扩展工作。
6. 6. **基于logit的路由上的负发现**:此任务上的基础结构选择路由是一个伪装成**校准**问题的**问题分类**问题。一个110M参数的DistilBERT仅凭问题文本就击败了所有基于logit的路由器(Llama上F1+14.9,p=4e-4;Qwen上F1+8.1,p=0.018);P(True)在重度RLHF的Llama-3.1-Instruct上完全崩溃。路由问题简化为问题上的约89%准确率的"存在vs缺失"分类器;logit信号是多余的。

### 1.3 本文**不**主张的内容
我们不主张γ\-LoRA是可部署的基础结构(LaMP-3排除了这一点),不主张校准头是完善的机制(它是一个消融实验),也不主张超越带级别的机制可解释性(带内头部隔离是未来工作)。论点是**测量拆分**,而非新架构。

### 1.4 路线图
§2将工作置于个性化基准、参数化记忆和检索增强记忆的背景中。§3指定诊断框架。§4报告每个轴的结果、LaMP-3缓解交叉乘积(§4.3.6)、跨模型复现(§4.6)和路由基线基准(§4.7)。§5建立因果机制。§6讨论局限性。代码和合成语料库可在https://github.com/EpistemicaLab/substrate-asymmetry-memory获取。

## 2 相关工作
我们将本文定位在三方面交叉点:用户侧个性化基准(LaMP、PERSOMA、UQABench)、记忆架构(基于RAG的智能体、参数化按用户适配器)以及语言模型中的校准/弃权。

### 2.1 个性化基准
**LaMP**(Salemi等人,2024 (https://arxiv.org/html/2606.11712#bib.bib29))是规范的用户侧个性化基准——七个任务,带有保留的用户历史,通过精确匹配或评分MAE评分。**PERSOMA**(Hebert等人,2024 (https://arxiv.org/html/2606.11712#bib.bib10))引入在用户历史上训练的人物条件软标记;**UQABench**(Liu等人,2025 (https://arxiv.org/html/2606.11712#bib.bib21))针对带聚合评估的用户问答。
这三者都将用户侧记忆评为单一能力。
我们的贡献是按轴分解:赢得LaMP风格模仿的相同基础结构可能在相同用户上以90pp失去事实缺失性,而聚合指标不呈现这一点。

### 2.2 记忆架构
**参数化适配器**(Hu等人,2022 (https://arxiv.org/html/2606.11712#bib.bib11);Lester等人,2021 (https://arxiv.org/html/2606.11712#bib.bib15);Li & Liang,2021 (https://arxiv.org/html/2606.11712#bib.bib17))和**人物条件LoRA**(Huang等人,2024 (https://arxiv.org/html/2606.11712#bib.bib12))在历史上训练按用户权重。**检索架构**(Lewis等人,2020 (https://arxiv.org/html/2606.11712#bib.bib16);Borgeaud等人,2022 (https://arxiv.org/html/2606.11712#bib.bib4))和**智能体记忆系统**(Packer等人,2023 (https://arxiv.org/html/2606.11712#bib.bib25);Park等人,2023 (https://arxiv.org/html/2606.11712#bib.bib26);Chhikara等人,2024 (https://arxiv.org/html/2606.11712#bib.bib7);Zhong等人,2024 (https://arxiv.org/html/2606.11712#bib.bib37);Xu等人,2024 (https://arxiv.org/html/2606.11712#bib.bib34))维护外部存储。
大多数已发表评估对一个基础结构对比无历史基线进行评分,而非两个基础结构在按轴探测上相互对比。我们将γ\-LoRA与BGE检索正面交锋,在相同的50个用户上使用三个正交探测;由此产生的基础结构-任务不对称性,据我们所知,是新颖的。在附录E中提供完整的比较表,涵盖{生成智能体、Mem0、MemoryBank、A-MEM、MemGPT/Letta}和我们的工作。

### 2.3 校准与弃权
LLM校准通过TruthfulQA(Lin等人,2022 (https://arxiv.org/html/2606.11712#bib.bib20))、选择性预测(Kadavath等人,2022 (https://arxiv.org/html/2606.11712#bib.bib13))和弃权提示方法(Asai等人,2024 (https://arxiv.org/html/2606.11712#bib.bib2);Yang等人,2023 (https://arxiv.org/html/2606.11712#bib.bib35))进行研究。与我们缺失探测最接近的框架是检索即弃权。
先前工作仅对事实内容进行校准评分;我们将其评分为三轴分解中的一个轴,其中赢得风格的基础结构失去校准。
这将按用户记忆置于更广泛的"校准税"文献中(Schulman,2023 (https://arxiv.org/html/2606.11712#bib.bib30);Ouyang等人,2022 (https://arxiv.org/html/2606.11712#bib.bib24)),带有更尖锐的证伪器。

## 3 方法
我们在相同的50个人物语料库上评估三种记忆基础结构:**B\_nohist**(基础模型,无用户历史;负对照)、**C\_rag**(在用户历史上进行BGE top-K=5检索,带有低相关性时弃权的提示子句)和**C\_lora**(按用户γ\-LoRA,秩64–128,在四个注意力投影上——查询、键、值、输出——在与RAG检索相同的按用户历史上训练)。第四个配置**C\_lora\_calib**在γ\-LoRA推断中添加相同的弃权提示子句,提供§4.2中使用的匹配提示比较。基础模型主要为Qwen3-4B-Instruct;Llama-3.1-8B-Instruct和Mistral-7B-Instruct-v0.3作为跨模型复现添加(§4.6,n=3系列检查)。*外部记忆基线(Mem0、MemGPT)* 在补充材料中报告;完整结果推迟到附录讨论(附录B.4)。所有四个配置在**三个探测**上评估:行为记忆(§4.1:写作提示续写对数似然 + n=750处的盲偏好)、事实校准(§4.2:在我们的50用户合成语料库上的合成缺失/存在探测,12个探测×50个人物×4个配置 = 2,400条记录)和真实数据迁移(§4.3:LaMP-3产品评分,50个用户;Salemi等人,2024)。第四个**机制探测**(§5)在n=50个γ\-LoRA适配器(每个人物一个)上进行每个人物注意力权重-增量分析,带一个带归零因果干预。n=50样本量受评判预算限制:完整缓解矩阵为12×50×4×9≈21,600条记录,§4.3.6中的交叉乘积增加另外9×50 = 450个LaMP-3评估;>40pp的效应量在此规模下可检测,附录B中较小的效应带有明确的置信区间。合成语料库(50个用户,30轮历史)由Anthropic Claude Sonnet 4.6生成,以单个人物模板提示(三种之一:作家/专业人士/爱好者)加上4–6个人口统计和生活方式属性的随机种子为条件;每个人物产生一个30轮对话历史。

相似文章

Know It, Act on It: Investigating Memory Utilization in LLM Personalization

arXiv cs.CL

This paper introduces a decoupled evaluation paradigm to separate memory recall from actual utilization in LLM personalization, finding that agents often recall user preferences but fail to act on them in behavioral scenarios. Large-scale experiments across 16 systems and five memory architectures reveal a significant Know-Act gap, especially for health-related preferences.

基于文件系统的LLM Agent记忆:组织、演化与可持续性

arXiv cs.CL

本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。