从检索到权重:基于个体文本语料库的小型语言模型参数化个性化

arXiv cs.CL 论文

摘要

本文探讨通过DoRA微调将个体文本语料库整合至模型权重,从而实现小型语言模型的参数化个性化。研究发现,尽管在广义知识测试中可测量到显著的个体化效应,但与通用知识的对齐度提升有限。

arXiv:2609.10155v1 公告类型:新研究 摘要:我们从认知模拟视角出发,探讨基于情景记忆与语义记忆的多选题问答机制,通过将个体文本语料库(ITC)文本整合至检索增强生成与DoRA微调过程。我们网络爬取了515名参与者的搜索历史记录,这些参与者回答了36道多选知识题,并对分层抽样的150名参与者数据进行分析。针对每位参与者,我们使用一个DoRA适配器将其ITC整合至基准正确率低于参与者最低四分位数的小型语言模型中。该适配器能显著地将ITC写入模型权重:其对特定参与者保留文本的拟合度显著优于其他参与者文本(效应值dz=1.27),这种个体化效应随ITC规模增长而按等级提升。然而在广义知识测试中,适配器主要增加的是知识量而非与个体的对齐度:对数损失匹配度有所提升,但经偏差校正的PMI解读法下的匹配准确率未见改善,且检索机制未能在此基础上带来增益。我们的研究证实ITC可被整合至SLM权重中,这为构建个性化教学智能体提供了可行基础,并进一步探讨了如何在此基础上实现个体层面的情景记忆与语义记忆模拟。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:20

# 从检索到权重:基于个人文本语料库的小型语言模型参数化个体化
来源:https://arxiv.org/html/2609.10155

###### 摘要

我们采用认知模拟的视角,研究情景记忆和语义记忆在多项选择问答中的作用,方法是将个人文本语料库(Individual Text Corpus, ITC)的文本整合到检索增强生成和DoRA微调中。我们网络爬取了515名参与者的搜索历史,这些参与者回答了36道多项选择知识题,并分析了其中150名参与者的分层子样本。对每位参与者,一个DoRA适配器将其ITC整合进一个基线正确率低于该参与者最低四分位数的小型语言模型(SLM)。该适配器可测量地将ITC写入了模型权重:它对自身参与者所持文本的拟合优于对其他参与者的文本(d_z=1.27),这种个体性效应随ITC大小呈等级增加。然而,在广义知识测试中,该适配器添加的是知识而非与个体的对齐:其对数损失匹配度提升,但经偏差校正的PMI读出的匹配准确率并未提升,且检索在此基础上未增添任何效果。我们的结果表明,ITC可以被整合进SLM的权重中,这为个性化辅导智能体提供了有希望的基础,我们还讨论了如何以此为基础,在个体层面上实现对情景记忆和语义记忆的逼真模拟。

## 1 引言

认知科学和自然语言处理(NLP)的一个关键目标,是从语言模型(LMs)中复制或提取人类知识。这方面的大部分工作都在群体层面展开:从词和文本嵌入中恢复聚合的人类知识(Grand等人,2022),将LMs作为通用的认知主体进行探测(Binz和Schulz,2023),并将其输出与分散在群体中的知识对齐(He-Yueya等人,2024)。然而,个体之间所知的内容差异巨大(Rolfhus和Ackerman,1999;Hambrick和Engle,2002)。因此,在个体而非聚合层面复制知识,是一个独特且很大程度上开放的挑战。

人类关于世界的知识储存在语义记忆中,它将一般事实与用于单一个人事件的情景记忆分开存储(Tulving, 1972;Tulving, 2002)。用心理测量学术语来说,这种积累的知识被称为晶体智力(Gc)。当流体能力投入到特定领域的学习中时,晶体智力就会增长,这受到人格和兴趣的影响(Cattell, 1963;Horn和Cattell, 1967;Ackerman, 1996)。开放性-流体-晶体智力(OFCI)模型将此框架为环境丰富化(Ziegler等人,2012;Trapp等人,2019)。根据OFCI模型,开放性促使人们寻求能增强流体能力的刺激环境,从而建立晶体智力。互联网被视为这样一种丰富化的环境:一个人所知道的大部分内容都是通过参与在线内容而构建的。一个人的搜索历史记录了他们参与过的内容,从而追踪了他们个体获得的、与知识构建相关的信息。我们利用这些信息为每个人创建了一个个人文本语料库(Individual Text Corpus, ITC),具体描述见Hofmann等人(2024)。这个数据结构是我们工作的核心。

大型语言模型(LLMs)存储了大量的事实知识(Petroni等人,2019),但这种知识是通用的,不与特定个体绑定(Zhang等人,2025)。一项先前研究调查了是否可以从个人自身数据模拟个体知识(Wigbels等人,2026)。该研究结合了316名参与者的Google搜索历史与检索增强生成(RAG),以预测每位参与者在多项选择知识题上的答案。该研究引入了我们在此重用的三个答案对齐基准:匹配准确率、对数损失匹配和CK-准确率(晶体知识准确率;定义见第3.5节);研究发现了可检测的个体信号,匹配准确率高于随机水平,但校准度低,对参与者答案的概率预测较低。

检索是个人知识进入模型的一条途径。语义知识并不局限于其获得的具体情境或事件。通过一个称为巩固的过程,情景经验逐渐被重组为分布式的语义知识存储(McClelland等人,1995)。RAG模仿了情景步骤:它将参与者的ITC保存在一个外部存储中,并在推理时查询它。第二步是将参与者的ITC巩固到记忆权重本身中。我们使用每个参与者的DoRA(权重分解低秩自适应)适配器(Liu等人,2024)来实现这种方法,这是一种参数高效的持续预训练形式,它将ITC写入低秩权重更新,同时保持基础模型冻结。这反映了参数高效微调作为个性化LLMs以服务个体用户的最新进展(Tan等人,2024)。因此,我们将模拟个体知识的问题重新定义为参数化个体化问题。这种方法关注的是,一旦个人知识被编码到模型权重中,它是否与他们的实际反应相对应。

使用ITC作为个人知识的代理,并将其映射到经过相应微调的SLM的权重上,改变了有效读出方式应有的样子。标准的强制选择评估从选项标识符(IDs)的首词概率中读出答案(Zheng等人,2024)(IDs;即四选项问答中的A、B、C或D)。这预设模型能够遵循指令,而它可能做不到。在连续文本上进行持续预训练涉及预测下一个令牌,而非遵循指令。因此,对于参数化个体化,读出方式的选择是构成性的而非附带的(第2.3节)。因此,我们保留了先前研究(Wigbels等人,2026)的基准定义,但我们基于所有四个设计单元格中选项A-D的似然度来操作化这些基准(参见第3.5节)。这种从检索到权重的转变,对应着测量从答案接口到答案内容的转变。我们测试三个假设:

- H1 参数化个体化:添加特定参与者的适配器可以提高与参与者答案的匹配度:与基线相比,在所有检索条件下,匹配准确率提高,对数损失匹配降低。
- H2 适配与检索:适配器和检索通过不同的途径达到个体信号,因此它们的效果不一定相加。为检验H2,我们考察它们的交互作用:将知识写入权重是替代检索(在没有RAG时适配器效应更大)还是补充检索(在RAG下适配器效应持续存在)。
- H3 对ITC大小的鲁棒性:在统计控制ITC大小后,适配器和检索效应仍然存在(参与者的ITC大小在几个数量级上变化)。

我们在一个2×2设计中评估我们的假设,该设计将个性化的语义记忆模型与基于RAG的情景记忆检索交叉。第一个因子对比冻结基线与携带参与者DoRA适配器的基线。第二个因子对比不进行检索的回答与基于Wigbels等人(2026)的基于ITC的RAG(ITC-RAG)检索。所有四种条件均基于Wigbels等人(2026)的三个答案对齐基准进行评分:匹配准确率、对数损失匹配和CK-准确率。

## 2 相关工作

### 2.1 个人文本语料库与记忆巩固

个人文本语料库基于这样一个前提:一个人所接触文本的足够大样本,近似于该个体所获得的知识——这种方法最初用于个体阅读行为,后由Hofmann等人(2024)扩展到网络规模的搜索历史。本文扩展的研究最初通过检索应用了这一前提,将语料库存放在外部存储中(Wigbels等人,2026)。

这种ITC的查询方式映射了人类记忆的组织方式。互补学习系统理论区分了一个快速的情景系统和一个缓慢的新皮层系统,后者将重复经验巩固为分布式的语义表征(McClelland等人,1995),这种区分越来越多地被用来解释语言模型中的记忆,其中检索作为一种情景机制在推理时提供上下文(Dong等人,2025;Fountas等人,2025)。将ITC巩固到权重中是其语义对应部分,本研究比较了这两种途径。

### 2.2 参数高效微调与个性化LLMs

适应特定用户最常通过输入端的方法来实现,即在推理时检索用户特定文档或根据用户历史进行条件设定(Zhang等人,2025)。一种互补的方法则调整模型参数。参数高效微调(Parameter-efficient fine-tuning, PEFT)使得在每个用户一个模型的规模上实现这一点成为可能,因为每个人只存储一个小的适配器,而基础模型是共享的(Tan等人,2024)。低秩自适应(LoRA)是主要的PEFT家族,Liu等人(2024)在此基础上扩展了DoRA,它将每个权重分解为大小和方向,从而使其学习行为更接近全量微调。然而,将新内容写入权重会与模型已有的知识相互作用。Biderman等人(2024)表明,低秩更新比全量微调获取的新材料少,但对基础模型现有行为的扰动也更小,而在狭窄语料库上进行持续预训练且没有回放(即没有将通用数据交错插入训练流)是导致通用能力(包括遵循指令能力)退化的已知原因(Ibrahim等人,2024;Luo等人,2023)。这种退化是训练机制的属性,而非模型大小的属性,遗忘并不与模型大小呈单调关系(Ramasesh等人,2022;Luo等人,2023)。因此,我们选择DoRA是因为它具有更高的适应能力,适合将ITC写入小型基础模型;随之而来的指令遵循能力丧失并非模型失败,而是一个测量问题,第2.3节将对此进行探讨。

### 2.3 测量强制选择的回答行为

如何从LLM中提取答案并非中立。一系列工作表明,强制选择读出带有模型端的响应偏差:LLMs偏好特定的选项ID,无论内容如何,调查式问题会放大这一效应(Dominguez-Olmedo等人,2024),消融研究将该决策定位在ID令牌本身,而非选项的排序位置(Zheng等人,2024)。另一系列工作将读出与答案本身区分开来:Wang等人(2024b)表明,首词概率排序最高的选项经常与模型生成的文本答案不同,当指令遵循能力下降时,这种不匹配会增加,并且文本答案比首词概率(包括去偏后的概率)对选项重排和问题扰动更具鲁棒性(Wang等人,2024a)。通过其长度归一化似然度对选项内容进行评分是较早的读出方法,对于不遵循指令的模型来说仍是标准方法(Wang等人,2024a)。对于本研究,这些发现带来的是设计上的考量而非警告:通过原始持续预训练获得的适配器在设计上并非指令遵循者,因此所有四个单元格都基于选项内容进行评分(第3.5节)。

## 3 方法

### 3.1 设计概览

参见图注:图1:研究概述。图1总结了研究设计。我们选择了Qwen3-0.6B作为基础模型,因为研究发现较小的语言模型在知识分布上比大的模型更符合人类知识分布(He-Yueya等人,2024)。基础模型保持bfloat16精度冻结;每个参与者的适配器规格见第3.4节。

### 3.2 参与者与知识评估

参与者通过大学海报、SONA系统和个人招募方式招募。资格要求包括:精通德语、至少一年积极使用Google账户、完成一份涵盖知识、人格、兴趣、流体智力和人口统计信息的在线调查(时长60至90分钟)。参与者获得课程学分或最高18欧元的报酬。如果参与者未提供有效的搜索历史文件,或者由此生成的ITC低于最小规模标准(2,500个独特词类),则被排除。晶体知识通过36道多项选择题进行评估,包括BEFKI GC-K短量表的12个项目(Schipolowski等人,2014)和24个新开发的项目,每个项目都有一个问题干、四个答案选项,并且只有一个正确答案(示例项目见附录A)。应用这些标准后,有515名参与者符合条件。本研究基于其中的N=150的分层子样本,该子样本在ITC大小范围内抽取,并在两端修剪了异常值。其中十二名参与者未通过连续性

相似文章

人类认知与行为的小型基础模型

Hugging Face Daily Papers

本文在Psych-101数据集上训练了14个小语言模型(参数规模从1.35亿到140亿),该数据集包含来自160个实验的1070万次逐试次人类选择。研究发现,小型模型足以匹配分布内数据,而大型模型在分布外泛化方面表现更好。诊断结果表明,遮蔽刺激和反馈会破坏大部分已学信息,表明仅凭选择历史是不够的。

跨语言探索参数化知识

arXiv cs.CL

本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。

迈向LLM的下一个前沿:私有数据训练——联邦微调的跨域基准

arXiv cs.LG

本文提出了一个在私有数据上对大型语言模型进行联邦微调的跨域基准,评估了LoRA、QLoRA和IA3策略在医疗和金融数据集上的表现。结果表明,联邦微调接近集中式训练的性能,并优于孤立学习,证明了在数据无法共享时通过联邦微调适配LLM的可行性。