TELLME:用于语言模型丰富化的测试增强学习

arXiv cs.CL 论文

摘要

本文提出了TELLME,一种用于大语言模型持续预训练的测试增强学习方法,它提升了领域特定知识的获取和长期记忆保持,在金融领域优于现有方法。

arXiv:2608.11788v1 公告类型:新 摘要:持续预训练(CPT)已被广泛用作大语言模型领域自适应的一种方法。然而,CPT始终伴随着挑战,例如获取大规模领域特定数据集的困难和高昂的计算成本。在本研究中,我们提出了一种名为测试增强学习用于语言模型丰富化(TELLME)的新方法,以缓解这些问题。TELLME利用了测试增强学习(TEL)原理,通过在训练过程中使用测验来提高模型的训练效率。它将这一原理与CPT相结合,从而促进高效的领域特定知识获取和长期记忆保持。实验结果表明,TELLME在金融领域比现有方法高出高达23.6%,并在长期记忆保持方面实现了9.8%的提升。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:28

# TELLME:面向语言模型增强的测试增强学习

来源:https://arxiv.org/html/2608.11788

Minjun Kim Inho Won††footnotemark:Hyeonseok Lim MinKyu Kim
感谢:̃ ̃ ̃这些作者对这项工作贡献相同
所属机构:韩国科学技术院
所属机构:韩国科学技术院
所属机构:韩国科学技术院
所属机构:首尔科学技术院
Junghun Yuk Wooyoung Go Jongyoul Park Jungyeul Park KyungTae Lim
感谢:̃ ̃ ̃通讯作者
所属机构:韩国科学技术院
所属机构:韩国科学技术院
所属机构:韩国科学技术院
所属机构:首尔科学技术院
所属机构:国家安保战略研究院
\{mjkmain, inho\.won, ktlim\}@kaist\.ac\.kr

###### 摘要

持续预训练(CPT)已被广泛用作大型语言模型领域适配的一种方法。然而,CPT始终伴随着诸多挑战,例如获取大规模领域特定数据集困难以及计算成本高昂。在本研究中,我们提出了一种名为“用于语言模型增强的测试增强学习”(Tellme)的新方法,以缓解这些问题。Tellme利用了测试增强学习(TEL)原理,通过训练期间的小测验来提高模型的训练效率。它将这一原理与CPT相结合,从而促进高效的领域特定知识获取和长期记忆保持。实验结果表明,Tellme在金融领域比现有方法最多提升23.6%,并在长期记忆保持方面相比标准CPT实现了9.8%的提升。该模型和Tellme数据集可在huggingface.co/anonymous4459 (https://huggingface.co/anonymous4459) 获取。

## 1 引言

近年来发布的大型语言模型(LLMs)在各种自然语言处理(NLP)任务中展现出了卓越的性能,并被广泛使用(1 (https://arxiv.org/html/2608.11788#bib.bib27);5 (https://arxiv.org/html/2608.11788#bib.bib26))。然而,为了将这些模型定制到特定领域或任务特定需求,需要通过持续学习(CL)融入领域特定知识。根据目标不同,已有利用持续预训练(CPT)、指令微调(IT)或强化学习(RL)的CL方法被提出(17 (https://arxiv.org/html/2608.11788#bib.bib28);25 (https://arxiv.org/html/2608.11788#bib.bib4);35 (https://arxiv.org/html/2608.11788#bib.bib1))。在这些方法中,使用CPT进行额外训练通过融入目标领域的内在知识,已被认为是开发领域特定LLMs的有效方法。尽管如此,CPT仍面临几个挑战:(1)获取大量领域特定的训练数据往往很困难,(2)训练过程需要大量的计算资源(37 (https://arxiv.org/html/2608.11788#bib.bib3))。

参见图注

图1:使用InstPT和Tellme方法生成的QA对示例。InstPT采用阅读理解式QA,直接从上下文中提取答案,而Tellme则通过深入QA来强化知识。

为了解决这些问题,研究人员提出了各种方法,通过对CPT数据进行进一步处理或增强来执行有效的CPT。一个值得注意的进展是,从传统的先CPT后IT的顺序训练方法,转向将IT数据直接整合到CPT过程中的方法。这种整合方法已显示出良好的效果(9 (https://arxiv.org/html/2608.11788#bib.bib14);20 (https://arxiv.org/html/2608.11788#bib.bib15);21 (https://arxiv.org/html/2608.11788#bib.bib9))。一个代表性示例是InstPT,如图1 (https://arxiv.org/html/2608.11788#S1.F1)所示,其中CPT与与纯文本相关的QA样本同时进行(9 (https://arxiv.org/html/2608.11788#bib.bib14))。这种方法有效地引导模型更高效地编码纯文本知识。

先前提出的方法有一个共同特征:它们将测试整合到训练过程中,类似于教育心理学中的测试增强学习(TEL)框架(30 (https://arxiv.org/html/2608.11788#bib.bib29))。TEL已被证明可以通过在学习过程中引入测试来提高长期记忆保持。然而,现有方法如InstPT和预指令微调(20 (https://arxiv.org/html/2608.11788#bib.bib15))偏离了TEL所建议的有效测试策略。研究表明,开放式解释性回答,而非简单的回忆或多项选择形式,能产生更强的长期保持效果(22 (https://arxiv.org/html/2608.11788#bib.bib30);13 (https://arxiv.org/html/2608.11788#bib.bib36))。相比之下,InstPT中的问答格式,如图1 (https://arxiv.org/html/2608.11788#S1.F1)所示,在很大程度上受限于给定文本,限制了其激发内在知识的能力。

受这些发现的启发,我们假设将TEL的内在知识回忆原理应用于CPT,既能提高知识获取的效率,也能增强所学表示的持久性。为了验证这一假设,我们提出了“用于语言模型增强的测试增强学习”(Tellme)。如图1 (https://arxiv.org/html/2608.11788#S1.F1)所示,Tellme通过联合训练纯文本与需要超出给定上下文进行解释性推理的描述性QA样本来扩展传统CPT。我们使用GPT-4o-mini以经济高效的方式构建了10万个领域特定的Tellme样本,确保高问题多样性以激发模型的内在知识。

我们通过领域特定的持续训练和长期保持实验来评估Tellme。为金融和医学领域构建了训练数据集,并使用多种规模的模型进行了额外训练,包括LLaMA(12 (https://arxiv.org/html/2608.11788#bib.bib5))和SmolLM(3 (https://arxiv.org/html/2608.11788#bib.bib2))。实验结果表明,Tellme在金融理解基准上相比CPT+IT基线最多提升23.6%,在长期保持方面相比标准CPT实现了9.8%的提升。我们的主要贡献总结如下:

- •我们提出了Tellme,一种持续预训练框架,可增强LLMs中的知识获取和长期保持。
- •我们提出了一种经济高效的流水线,用于为领域特定持续训练生成大规模、多样化的QA数据。
- •我们在金融和医学领域对Tellme进行了实证验证,证明其相比传统CPT和CPT+IT方法有显著提升。

## 2 相关工作

在本节中,我们介绍所提出的Tellme方法的基础概念:(1)测试增强学习,(2)LLMs中的持续学习,(3)基于QA的持续学习。

### 2.1 人类的测试增强学习

测试增强学习(TEL)(30 (https://arxiv.org/html/2608.11788#bib.bib29))是人类使用的一种领域优化学习方法,是认知心理学中研究的概念。与测试仅仅作为评估工具的一般看法不同,TEL已被证明能主动促进学习并增强记忆保持。这种现象被称为测试效应,研究表明,当与概念映射(即描述不同知识片段之间关系)结合时,它尤其能展现出协同效益(13 (https://arxiv.org/html/2608.11788#bib.bib36))。此外,研究表明TEL有助于领域特定信息的长期保持。由于这些优势,TEL已被应用于各个领域(6 (https://arxiv.org/html/2608.11788#bib.bib19);4 (https://arxiv.org/html/2608.11788#bib.bib37))。许多医学教育研究报告指出,需要简答或描述性回答的考试比多项选择题更能有效巩固学习(23 (https://arxiv.org/html/2608.11788#bib.bib34);40 (https://arxiv.org/html/2608.11788#bib.bib18);29 (https://arxiv.org/html/2608.11788#bib.bib35))。

### 2.2 面向LLMs的持续学习

LLMs的领域优化方法主要利用持续学习,使其能够适应新的数据分布或领域。在此框架内,已有多种方法被探索以增强特定领域(38 (https://arxiv.org/html/2608.11788#bib.bib16);21 (https://arxiv.org/html/2608.11788#bib.bib9))、任务(16 (https://arxiv.org/html/2608.11788#bib.bib23))和语言(14 (https://arxiv.org/html/2608.11788#bib.bib22)),以及使模型持续更新新出现的信息(24 (https://arxiv.org/html/2608.11788#bib.bib24);34 (https://arxiv.org/html/2608.11788#bib.bib25))。领域扩展的具体示例可在附录F (https://arxiv.org/html/2608.11788#A6)中找到。

### 2.3 基于QA的面向LLMs的持续学习

人类的测试增强学习(TEL)概念与LLMs的额外训练方法最近在基于QA的CPT中汇聚。一个显著例子是20 (https://arxiv.org/html/2608.11788#bib.bib15)提出的预指令微调方法,它将纯文本和QA样本整合到一个混合训练过程中,使模型能够同时学习段落和QA对。据报道,这种方法有助于在训练过程中高效地将纯文本知识内化。另一项值得注意的研究是从知识保持的角度提出的。21 (https://arxiv.org/html/2608.11788#bib.bib9)观察到,在持续预训练期间,由于指令跟随能力的丧失会出现性能下降,并提出了一种利用预训练语料库和指令跟随数据集混合的方法来解决该问题。同时,也有研究通过基于QA的CPT来增强特定语言。例如,7 (https://arxiv.org/html/2608.11788#bib.bib21)提出了一种针对英语和中文的CPT方法,利用合成QA数据提升模型在科学领域的性能。此外,基于QA的CPT也被探索用于加强阅读理解能力。10 (https://arxiv.org/html/2608.11788#bib.bib13);9 (https://arxiv.org/html/2608.11788#bib.bib14)引入了InstPT,一种利用基于模板的合成QA数据来增强特定任务的指令预训练方法。该方法在医学领域展现出了显著改进。

## 3 Tellme

用于语言模型增强的测试增强学习(Tellme)是一种通过在CPT期间利用QA数据来提高知识获取效率并确保所学知识长期保持的方法。为实现这一目标,本研究通过(1)语言建模回顾,(2)从纯文本生成问答对,以及(3)训练框架的设计来描述Tellme方法。

### 3.1 语言建模

为便于更好地理解所提出的Tellme,我们总结了因果语言建模(CLM)、预训练(PT)和指令微调(IT)的关键概念,这些构成了CPT的基本训练方法。

#### 因果语言建模(CLM)

LLMs使用CLM目标进行优化,该目标根据前面的上下文预测下一个token。该目标可公式化如下:

Lclm(θ)=−1K∑i=1N1(xi)logP(xi|x1M\>1时,该结构可以通过QA拼接扩展到X=(t,q1,a1,...,qM,aM)\{\color[rgb]{0,0,0}\mathbf{X}\}=(\mathbf{t},\mathbf{q}_{1},\mathbf{a}_{1},\ldots,\mathbf{q}_{M},\mathbf{a}_{M})。为明确反映测试效应,我们使用了Tellme数据集,该数据集的单个样本中同时包含纯文本和QA。具体而言,在等式1 (https://arxiv.org/html/2608.11788#S3.E1)中,我们将指示函数配置为1(xi∈t∪a)=1\mathds{1}(x_{i}\in\mathbf{t}\cup\mathbf{a})=1,1(xi∈q)=0\mathds{1}(x_{i}\in\mathbf{q})=0。这确保模型只训练预测纯文本和答案部分,同时将问题部分q\mathbf{q}排除在损失计算之外。从同时使用纯文本和QA样本的混合训练角度来看,该方法可视为传统CLM方法的自然扩展,兼顾了CPT和IT训练范式。因此,它纳入了Tellme框架。

表2:不同训练方法下金融和医学领域的性能比较。

## 4 实验

在本节中,我们展示了所提出的Tellme方法的定量评估流程和标准,并基于以下研究问题分析实验结果:(1)Tellme方法是否比现有方法更高效地获取领域知识?(2)它对长期记忆保持是否有效?

### 4.1 实验设置

在本研究中,我们聚焦于金融和医学领域,基于第3.2 (https://arxiv.org/html/2608.11788#S3.SS2)节所述方法,使用10万篇PubMed摘要和10万篇Bloomberg金融新闻文章构建数据集。实验中每个数据样本的QA对数量设置为M=3M=3。医学和金融领域都需要专业知识,并且此前的研究主要基于CPT进行性能验证(27 (https://arxiv.org/html/2608.11788#bib.bib38);28 (https://arxiv.org/html/2608.11788#bib.bib39))。金融评估基准包括FOMC(32 (https://arxiv.org/html/2608.11788#bib.bib20))、NIFTY(31 (https://arxiv.org/html/2608.11788#bib.bib17))和MMLU-F(inance)。医学领域则使用HeadQA(36 (https://arxiv.org/html/2608.11788#bib.bib10))、MedMCQA(26 (https://arxiv.org/html/2608.11788#bib.bib8))和MMLU-C(linic)(33 (https://arxiv.org/html/2608.11788#bib.bib11))进行评估。所有评估均使用lm-evaluation-harness(15 (https://arxiv.org/html/2608.11788#bib.bib7))以保证可复现性。附录A (https://arxiv.org/html/2608.11788#A1)提供了用于评估的基准数据集的详细描述。

表3:不同训练方法下金融和医学领域的性能比较。评估使用不同能力的最先进开源LLMs作为基础模型。具体而言,实验使用了Llama-\{3.2-1B, 3.2-3B, 3.1-8B\}(2 (https://arxiv.org/html/2608.11788#bib.bib6))和SmolLM2-1.7B(3 (https://arxiv.org/html/2608.11788#bib.bib2))。为评估所提出方法的有效性,我们将Tellme方法与基于基线模型和四种训练方法变体的现有方法进行了比较:

- •+cpt:指在领域特定文本上进行了持续预训练的模型。
- •+cpt+it:指基于+cpt模型在QA数据集上进行指令微调的模型(39 (https://arxiv.org/html/2608.11788#bib.bib33);8 (https://arxiv.org/html/2608.11788#bib.bib32);11 (https://arxiv.org/html/2608.11788#bib.bib31))。
- •+InstPT:该模型基于9 (https://arxiv.org/html/2608.11788#bib.bib14)提出的基于模板的QA生成方法进行训练。具体而言,金融领域平均生成5.8个短式QA对,医学领域平均生成1.25个长式QA对。

相似文章

Chain-of-Experience:持续大语言模型改进

Hugging Face Daily Papers

本文介绍了Chain-of-Experience,一种通过迭代测试时反馈实现大语言模型持续改进的方法,在各个领域展示了更好的性能和成本效益。

MLUBench: 多模态大语言模型终身遗忘评估基准

arXiv cs.AI

MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。

持续学习机制组合以实现长期记忆

Hugging Face Daily Papers

本文表明,结合互补的持续学习机制可以增强语言模型中的长期记忆,通过数据、功能和权重锚点以及合并的LoRA,将保留率提升28倍。