用于大语言模型时序评估与知识更新的合成世界

arXiv cs.CL 论文

摘要

论文提出了一种合成模拟框架和基准,用于评估和更新大语言模型中的知识,展示了比现有方法提高14.23%的效果。

arXiv:2609.00184v1 公告类型:新 摘要:大语言模型(LLMs)依赖于静态的预训练语料库,导致其知识随时间变得过时。现有的知识编辑评估方法要么容易快速污染,要么依赖于与刚性现有知识相冲突的反事实编辑。在这项工作中,我们提出了一种合成、模拟驱动的框架,用于研究LLMs中的知识插入。我们引入了{\sc ParallelEvents},一个基于虚构但现实的未来世界的基准,它生成连贯的事件轨迹以进行受控评估,在避免污染的同时保持一致性。基于此数据集,我们开发了{\sc Synapse},一个使用模型生成的数据通过中期训练和指令微调来更新模型参数的训练框架。这个合成管道实现了可扩展的知识集成,无需昂贵的人工整理数据。实证表明,{\sc Synapse}比现有方法高出14.23%,证明了基于模拟的合成训练能带来稳健且连贯的知识插入。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:46

# 面向大语言模型时序评估与知识更新的合成世界  
来源:https://arxiv.org/html/2609.00184  

邵子瑞  
单位:浙江大学  
[email protected]; [email protected]  

Alan Ritter  
单位:佐治亚理工学院  

Wei Xu  
单位:佐治亚理工学院  

###### 摘要  
大语言模型(LLMs)依赖静态预训练语料库,导致其知识随时间推移逐渐过时。现有的知识编辑评估方法要么面临数据快速污染问题,要么依赖与现有固化知识冲突的反事实编辑。本研究提出一个基于合成模拟的框架,用于探索LLMs的知识注入。我们引入 **ParallelEvents** 基准数据集,包含虚构但现实的未来世界场景,能够生成连贯的事件轨迹以实现可控评估,在避免数据污染的同时保持内部一致性。基于该数据集,我们开发 **Synapse** 训练框架,通过模型生成的数据进行中期训练和指令微调,更新模型参数。这一合成流水线实现了可扩展的知识整合,无需昂贵的人工标注数据。实验表明,**Synapse** 比现有方法性能提升14.23%,证明基于模拟的合成训练能够实现稳健且连贯的知识注入。  

## 1 引言  
大语言模型(LLMs)正日益被用作通用信息源。然而,这些模型基于静态语料库训练,将世界状态冻结在特定时间点,导致随着世界变化而出现幻觉、拒绝回答或过时响应等问题(Liska et al., 2022;Thede et al., 2025)。现有解决方法大多聚焦于孤立的事实变更,例如覆盖新引入的实体(Rijhwani and Preotiuc-Pietro, 2020;Onoe et al., 2023)或简单的政府领导权更迭(Zhong et al., 2025)。这些场景未能充分捕捉真实世界的复杂动态演化,且易因相关实体和事实后续进入训练数据而导致快速污染。本研究从基准构建与训练框架两个角度探讨该问题:引入内部一致的虚构世界作为抗污染环境以实现可控评估,并研究训练数据生成方式及其对模型知识获取与保持能力的影响。  

参见标题图1:**ParallelEvents** 概览——一个包含虚构但现实的未来事件(直至2035年)的平行宇宙,用于评估模型在时序变化下的知识注入效果。事实三元组分为关系型、因果型和属性型边。我们确保局部一致性(如单个事件中风速与灾害等级匹配)与全局知识图谱一致性(如同一时间地点不会出现两个台风),从而对知识注入进行严格评估。  

为使LLMs更好适应随时间变化的世界,先前研究探索了多种将新获取事实知识整合到语言模型中的方法。近期方法利用上下文学习与检索增强,在推理时向LLMs注入更新信息(Zhong et al., 2024;Zhong et al., 2025)。但此类提示信息可能与参数化知识或已训练的拒绝行为冲突。其他方法包括模型编辑(Meng et al., 2023a;Meng et al., 2023b),虽能定向更新模型参数,但存在可扩展性差与意外副作用问题。微调(Rozner et al., 2024;Xiong et al., 2025)与从头预训练能更彻底整合新知识,但需要持续更新的人工标注语料,成本过高。  

合成环境为人工标注语料提供了实用替代方案,可规模化生成数据并模拟世界。本研究利用这些优势解决两个问题:(1)基准污染问题——现实实体被后续训练数据吸收;(2)反事实脆弱性问题——虚构事实与现有常识冲突。然而纯自动生成可能引入不一致性,因此我们采用人工验证的混合方法。为此,我们引入 **ParallelEvents**(见图1),一个涵盖体育、自然灾害等领域的平行宇宙基准,包含合理但未发生的未来世界。这些事件自动构建但经过广泛验证,确保全局与局部一致性。重要的是,时序更新超越插入孤立事实,要求模型整合多个事实信息,并对演化中的世界状态进行推理。**ParallelEvents** 支持对不同知识截止日期模型进行此类可控细粒度评估,因其合成事件不像现实事件那样大规模进入训练语料。  

为探究合成训练能否有效支持时序知识更新,我们还开发了 **Synapse**(基于偏好引导编辑的合成增强)数据构建与训练框架,通过可扩展合成生成实现持续知识更新(第4节)。利用 **ParallelEvents** 种子事实,大型教师模型生成高质量数据,支持两个阶段:中期训练阶段向模型参数注入新事实知识;指令微调阶段强化知识同时抑制过时响应、幻觉及不当拒绝等行为。我们系统分析训练配置与合成数据混合比例,以平衡知识获取与行为对齐(第5节),这反映了现代LLM训练流程(Lambert et al., 2025;Olmo et al., 2025)。实验中,**Synapse** 在复杂事件上比现有基线(如MeLLo)提升14.32%(第6节)。最后,本文通过综合分析探讨事实编辑扩展性、外部基准泛化能力及对通用知识与指令遵循的影响(第7节)。  

## 2 预备知识  
语言模型常在静态假设下评估,但实际部署中事实持续演变。这种不匹配促使基准设计需隔离模型整合新信息同时保持现有知识的能力(见下文),且该能力应独立于模型训练时间(第3节)。  

参见标题图2:Wikipedia文章共现计数,衡量包含知识编辑事实三元组主谓宾的页面(如(英国, 属于, 欧洲→大洋洲))。在MQuAKE-CF和CounterFact中,38.43%和10.16%的事实出现在至少1000个Wikipedia页面,表明与预训练事实高度重叠。这些反事实编辑常与密集关联知识(如英国与欧洲足球)冲突,导致评估时出现不一致。相比之下,ParallelEvents仅0.39%实体存在≥1000页面重叠。  

**LLMs中的知识表示与更新**  
语言模型中的信息可表示为事实三元组集合(s, r, o),其中s为主语,r为关系,o为宾语。新信息出现时,可通过引入新三元组或修改现有三元组更新事实,即(s, r, o)→(s, r, o*)。给定新事实集合T={t1,...,tn}与模型πθ,知识更新(He et al., 2025)的目标是将T整合至更新模型πθ′并维持现有知识。这些更新通过数据集D={(xi, yi)}i=1N指定,每对包含查询xi与反映目标知识的期望输出yi。  

**现有知识更新基准**  
评估LLMs知识插入的研究利用外部知识源的时间戳快照。例如MQuAKE-T(Zhong et al., 2024)使用Wikidata捕捉政治职位变化。通过对比早期与后期快照,这些基准生成基于时序变化的问题,包括新造词(Zheng et al., 2024)、新命名实体(Luu et al., 2022;Rijhwani and Preotiuc-Pietro, 2020;Zhong et al., 2025;Thede et al., 2025)及概念转变(Jang et al., 2022;Kasai et al., 2024;Shah et al., 2025)。但此类数据集有效寿命较短(2021-2023),因其涵盖的更新¹快速进入较新LLMs的预训练语料,限制了实用性。虽可定期更新,但成本高昂且使不同知识截止日期模型的比较复杂化。  

为解决此限制,MQuAKE-CF(Zhong et al., 2024)等数据集使用反事实编辑评估知识更新,故意修改现实实体属性(如(英国, 属于, 欧洲→大洋洲))。通过修改固化世界知识,这些基准降低了预训练语料数据泄露风险(Rozner et al., 2024;Zhong et al., 2025;Meng et al., 2023a)。尽管编辑看似简单,但与相关事实及预训练数据获取的常识关联冲突(Ju et al., 2024),导致因知识冲突管理产生不现实的错误。例如,对高共现对(UK, part of, Europe)进行单反事实编辑后微调的LLaMA-3.1-8B(Touvron et al., 2023),在类似xi查询上仅达17.86%准确率。我们通过提取事实三元组主宾对(s,o)统计Wikipedia页面数量量化预训练数据中的事实普遍性,发现MQuAKE-CF和CounterFact中许多固化事实在大量文档中共现(统计数据与示例见附录D)。  

¹ 例如:(英国, 领导人, 鲍里斯·约翰逊→里希·苏纳克)  

## 3 LLM知识插入的时序不敏感评估  
参见标题图3:Synapse框架示意图,用于生成合成文本更新大语言模型。教师模型生成长文本数据集与问答偏好对,注入多跳与因果知识,同时促进对不可答查询的拒绝行为。不可信或生成错误的文本通过知识库重写。  

如第2节强调,评估前沿LLMs的知识更新需要避免数据污染与反事实扭曲的基准。为解决这两个限制,我们引入 **ParallelEvents**,一个包含复杂事件的平行宇宙基准:选举、体育赛事、自然灾害、新城市形成及经济危机,基于虚构但现实的非反事实未来事件构建,模拟真实时序更新。此外,为研究知识插入的涟漪效应,我们超越孤立事实元组,遵循Wikidata式知识图谱的结构原则(Vrandečić and Krötzsch, 2014)。具体而言,我们将新事件(见图1顶部)建模为图G=(V,R),其中R表示事实关系谓词集合,V中节点对应实体e,划分为新创建实体e_new∈V_new与已更新实体e_upd∈V_upd,满足V=V_new∪V_upd,V_new∩V_upd=∅。每个事件引发一组表示为类型化边的事实断言。我们定义两个不相交的事实三元组集合对应G中的知识插入:属性三元组T_attr与关系三元组T_rel。  

**属性边**:实体特定属性表示为三元组t_attr=(s, r_attr, a)∈T_attr,其中s∈V是实体,r_attr∈R_attr表示属性谓词,a∈A是来自属性空间A的字面值(含数字与日期,如(台风Kael, 风速, 130节))。  

**关系边**:实体间关系表示为三元组t_rel=(s, r_rel, o)∈T_rel,其中s,o∈V是实体,r_rel∈R_rel表示关系谓词(如(台风Kael, 位置, 日本))。  

**因果边**:我们使用有向因果边明确编码事件间的因果关系(如(台风Kael, 产生影响, 130 2032年冲绳洪水))。设R_causal⊂R_rel表示因果谓词集合。对于表示新事件的实体……

相似文章

合成验证:LLMs如何将认可与现实脱钩

Reddit r/ArtificialInteligence

本文认为,LLMs提供了合成验证,模仿了人类的认可而没有真实的风险,导致潜在的社会和心理后果,如韧性降低和孤立增加。

大语言模型能否用 TLA+ 建模实际系统?

Hacker News Top

Specula 团队的研究人员创建了 SysMoBench 基准测试,用于评估大语言模型能否准确建模实际计算系统的 TLA+ 规范,还是仅仅照本宣科地背诵教材内容。该基准测试涵盖四个阶段共 11 个系统,揭示了当前大语言模型在准确建模系统实现与参考论文方面的系统性差距。