无限参数LLMs:从实时数据生成与调整权重
摘要
本文提出一种无限参数LLM架构,该架构使用超网络通过贝叶斯更新从实时数据生成权重,实现持续适应并超越上下文学习。
暂无内容
查看缓存全文
缓存时间: 2026/09/17 18:13
# 无限参数大语言模型:基于实时数据生成与适配权重
来源:https://arxiv.org/html/2609.18842
Ross M\. Clarke
所属机构:Boltzbit Limited
Yichuan Zhang
所属机构:Boltzbit Limited
José Miguel Hernández\-Lobato
所属机构:剑桥大学、Boltzbit Limited
###### 摘要
缩放定律指出,语言模型的参数量越大、训练数据越多,其能力越强。混合专家模型(MoE)架构凭借此定律取得了显著成果,仅激活巨大参数库中的一小部分来处理每个标记(token)。然而这种成功建立在静态预训练数据之上。部署后的模型面临不同环境——许多能提升其有用性的数据并不在训练集中,而是存在于当前实时交互中,例如用户提供的事实或纠正。传统模型无法从这些数据中学习,因为其权重在训练后便冻结不变。于是运行时提供的知识与行为只能通过检索或指令放入提示(prompt)中,在每个请求中被反复读取,请求结束后即被丢弃。我们探索的是:模型架构能否通过将实时交互信息写入权重来实现学习?受MoE启发,我们提出了**无限参数大语言模型**。一个紧凑的超网络将运行时数据转换为对共享基础网络的低秩调制,使前馈权重能够从实时数据生成,而非存储于固定库中。与以往仅读取一次上下文即固定权重的生成器不同,我们在生成器潜在编码上维护一个贝叶斯信念,并在线更新该信念。因此,有效权重会随着会话推进从不断演化的信念中重新推导,而非一次读取后即固定。模型的存储足迹保持不变,而其能编译的权重却实际上无限多。将运行时提供的知识与行为存储于权重而非提示中,能摊销计算成本、释放上下文窗口、跨会话持续存在,并可能比上下文内使用具有更好的泛化能力。我们提出一套评估方案,专门对此进行验证,并与上下文学习和检索方法进行对比。
## 1 引言
五年来,打造更强大语言模型的可靠方法始终是:用更多数据训练更大模型。缩放定律精确刻画了数据与能力的关系:能力随训练数据量、参数量及计算量的增长可预测提升(Kaplan et al., 2020;Hoffmann et al., 2022)。数据已成为能力的核心要素。当前关于数据来源的两个事实正塑造着问题的形态。第一,静态预训练文本的供应量有限。现有模型预计在2026至2032年间将耗尽人类公开生成的文本存量(Villalobos et al., 2024),因此仅通过预训练更多数据来获取能力提升的捷径正逐渐消失。第二,也是我们研究的切入点:数据并非停止增长,而是改变了形式。部署的模型(以及越来越多基于它们构建的智能体)正产生海量且快速增长的**交互数据**——从用户提问、提交文档到给予纠正、智能体观察的结果。这些数据在推理时产生于真实使用场景,恰恰是模型最需要用来服务**此用户**、完成**此任务**的数据。如果数据是能力的燃料,那么下一个增长点就在这里。问题在于,当今模型无法在环路中从这些数据中学习。部署的模型是冻结的,刚刚发生的交互对其权重毫无影响。现有的变通方案都让数据留在**权重之外**。一类方案将其放入提示:检索、长上下文、少样本示例和系统提示将模型所需知识及应遵循行为置于上下文窗口中,在每个请求中逐词元重读,请求结束即丢弃。另一类方案则围绕冻结模型构建代理框架、工具编排与外部记忆,用工程脚手架管理数据,却从未改变网络本身。两者都回避了更根本的问题:如果宝贵的新数据由使用产生,模型就应当能**从中学习**,这意味着其权重必须改变。这正是我们探索的问题,它关乎**架构及其权重更新规则**,而非围绕它的框架。
要从实时交互中学习,模型需要能够以低成本在推理阶段吸收新知识、新行为,并保留重要信息的权重。我们从当前前沿的混合专家模型中获得灵感。MoE模型存储一个大型专家子网络库,每个标记仅路由通过其中少数几个;DeepSeek-V3拥有6710亿参数但每个标记仅激活370亿(DeepSeek-AI, 2024),Mixtral(Jiang et al., 2024)、Qwen3(Qwen Team, 2025)、Kimi K2和Llama-4等模型也处于类似规模。透过恰当的视角观察,这类模型与其说是分离专家的集合,不如说是一个权重随输入变化的单一网络。对于标记\(x\),MoE层应用的有效权重为\(W_{\text{eff}}(x)=\sum_{i}g_{i}(x)\,W_{i}\),这是由输入相关门控选择的存储专家的组合,这正是Bengio et al.(2013)与Shazeer et al.(2017)提出的条件计算构造。从这个意义上说,MoE是一个被赋予**动态**、逐标记权重的稠密前馈网络。我们以这个特性(而非其参数量)为起点。模型的权重**可以**成为输入的函数,而非固定常量。然而,MoE实现这一思想的两个方面限制了其在我们目标中的应用。其动态权重以内存为代价:虽然每个标记仅激活少数专家,但路由器可能选择其中任意一个,因此所有专家必须常驻内存。并且其选择的专家库在训练结束后固定不变,对每个用户、每个使用时刻都完全相同——无论是服务医生还是小说家,是在上午9点还是午夜,模型都从同一不变的调色板中提取。MoE的权重**随标记而变**,但它无法从面前的交互中学习,这与稠密模型无异。我们保留动态权重的理念,同时摒弃这两个限制:从紧凑网络生成权重而非存储专家库,并让权重在产生它们的标记之后持续变化。
生成机制使权重能够承载通常由提示携带的信息。这并未扩展小模型能**存储**的信息量,因为网络持有的信息量受其参数限制,MoE和稠密模型均约为每参数2比特(Allen-Zhu and Li, 2024);紧凑生成器遵循与其规模相同的约束。但重点不在存储。生成对比的对象不是更大的模型,而是**提示**。如今模型运行时所需的知识和行为以检索事实、任务指令或少量示范的形式存在于上下文中。而生成器可以**将相同数据编译进权重**,使用户的事实成为无需出现在提示中即可回答问题的权重。这正是“超网络即编码器”的理念,日益增长的研究已证明其有效(Charakorn et al., 2025)且可扩展:注入的知识随生成器规模提升遵循幂律增长,且比相同知识留在上下文中具有更好的分布外泛化能力(Dhankhar et al., 2026)。行为的编译方式相同,因为指令或示范集是生成器可以读入适配器而非提示的数据。并且由于任务适配占据内在维度极低的子空间(Aghajanyan et al., 2021),紧凑生成器与低维编码正是恰到好处的工具,而非尺寸不足。将数据存储在权重中而非每个标记都从上下文重读,能够摊销计算成本、释放上下文窗口,并持续存在超过一轮对话——这些优势提示都不具备,因为它在每个请求中被整体重读,结束时即被遗忘。
然而,“从数据生成”与“动态逐标记”之间存在差距,现有生成研究尚未解决,而弥合此差距正是我们的贡献。当前将上下文转换为适配器的权重生成器仅执行**一次**:它们单次读取整个上下文,输出一个适配器,然后在模型回答期间保持固定(Charakorn et al., 2025)。这是轮次级别的、**无记忆的**,因为适配器不会随更多词元到来而演化,也无法跨轮次保留信息。为符合我们最初的观点(MoE**每个标记**都变化权重),并让模型在**会话内**持续适应而非每轮重置,潜在编码不能一次读取后冻结。它必须在线推断。因此,我们将编码视为具有自身先验的潜在变量,并维护一个**信念分布**,随着证据到达而更新——粗略地每轮一次,或精细地每个标记一次——通过摊销的递归贝叶斯滤波实现。轮次级生成器为信念提供来自实时事实的强测量,在线滤波器则使信念在测量间隔间保持动态演化。二者共同生成既从数据产生又随时间演化的权重。推演到底,这产生了一个存储足迹固定但**有效权重**不固定的模型,因为它持续从运行时带来的任何数据中编译新权重。我们称之为**无限参数大语言模型**,并精确而严格地使用该术语。它指模型能实现的无界**有效权重与行为集合**——每个标记一个新专家,由连续编码产生,并由演化信念驱动。与普通模型形成对比的是:后者的权重在训练后固定,任何新信息的唯一通道是提示;在那里,可达行为受限于固定权重加有限上下文,而这里权重本身在每个步骤都从实时数据重新编译。
具体而言,我们用一个紧凑生成器替代存储的专家库,按需为每个标记合成专家,作为共享基础网络的低秩调制;该生成器由运行时数据驱动,并维护生成器所读潜在编码的贝叶斯信念,在会话过程中在线更新。图1(https://arxiv.org/html/2609.18842#S1.F1)将此机制置于模型将数据转化为能力的全景中;图2(https://arxiv.org/html/2609.18842#S2.F2)(§2.7)则将我们的架构与所借鉴的具体先前设计进行定位。模型权重变化的频率和数据新鲜度对比如下:
| 模式 | 数据来源 | 权重更新方式 | 更新频率与时机 | 更新后状态 |
|-------------------|----------------------|---------------------|--------------------|---------------------|
| **预训练** | 静态网络语料 | 所有权重 | 一次,离线 | 冻结 |
| **后训练**(SFT、RLHF) | 精选示范/偏好数据 | 大部分权重 | 偶尔,离线 | 冻结 |
| **实时学习(本文)** | 实时交互 | 生成的低秩编码 | 连续,在线,推理时 | 持续适应,可逆 |
| **上下文学习/检索** | 提示中的数据 | 权重不变 | 推理时每次请求重读 | 数据丢弃 |
图1:将数据转化为模型能力的三种模式,按权重更新频率及学习数据的新鲜度排序。预训练和后训练均离线、批量更新权重并保持冻结;二者主要区别在于数据类型和更新频率。本文提出的**实时学习**模式在推理时、在交互数据(事实、纠正、结果等)上连续更新生成的低秩编码,持续适应而非冻结。上下文学习和检索(底部)也在推理时行动,但不改变权重,将数据置于提示中每次请求重读后丢弃。这些模式互补而非竞争:实时学习并不取代预训练(§4),它触及预训练和提示未利用的数据。
这回应了我们最初提出的问题。仍在增长的数据由使用产生,而权重能从该数据编译的模型,可以在推理环路中立即将其转化为能力,而非等待下次预训练。随着交互积累,更多数据被写入权重,模型在当前任务上变得更有用。我们谨慎界定此主张的范围:会话适应是有限的、低维的、可逆的(§3.3),它并不推翻容量定律或取代预训练。我们实现的闭环是:实时数据能**进入权重并被使用**,封闭了冻结模型(无论是否提示或框架辅助)留下的开放路径,而非让模型从自身产物中无限增长。后续设计围绕权重与提示的对比展开。知识与行为来自生成器读取的运行时数据,而我们生成并适应的是低维部分——即哪种权重最契合当前上下文,以及它应如何随会话推进而漂移。在匹配预算下,将数据存储在权重中是否真的优于存储在提示中,正是我们的评估(§4)所测量的。
我们将此提案置于两个维度的自然进展中:权重来源,以及训练后是否可变。标准MoE及其无库变体(\(\mu\)MoE、\(\infty\)-MoE)从部署时固定的集合中**选择**,无论该集合是否无界,它都是冻结的。近期的权重生成器从上下文**生成**权重,但仅读取一次上下文便将适配器固定于当轮。我们迈出最后一步:专家空间既**从实时数据生成**又**在线适应**,其权重随数据和时间移动,并做出以下贡献。
1. 1\. **生成式专家架构及其设计空间**(§§3.2 和 3.3)。我们通过由潜在编码驱动的**生成式低秩增量**使共享基础前馈网络的权重动态化,无需存储专家库,并建立一个设计空间,通过每个架构偏离此结构的维度定位\(\infty\)-MoE、\(\mu\)MoE、DFC、HyperMoE和MoEGen。实例化的具体选择——基础网络与生成器形式——在§3.5中确定。
2. 2\. **无限参数视角**(§3.4)。精确阐述专家空间在何种意义上是无界的:一个连续空间。相似文章
学习,快与慢:走向持续适应的LLMs
一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。
快慢学习:迈向持续适应的大语言模型 [R]
本文提出了一种用于大语言模型的快慢训练框架,该框架结合参数更新与上下文优化,以提高样本效率并减少持续学习过程中的灾难性遗忘。
@hooshaaii: 大语言模型通常在训练后停止学习。"In-Place Test-Time Training" 通过实时更新MLP权重改变了这一点。
本文介绍了In-Place Test-Time Training,这是一个在推理过程中实时更新MLP权重的框架,使大语言模型能够动态适应并处理长达128k个令牌的长上下文。
通过注意力头重加权实现大语言模型的数据高效适配
介绍了一种数据高效方法——注意力头重加权(AHR),通过为每个注意力头学习单个标量来适配大语言模型至文本分类任务,大幅减少可训练参数,同时在有限数据场景下优于LoRA。
从权重到特征:SAE引导的激活正则化用于LLM持续学习
本文提出了一种用于大语言模型的持续学习方法,该方法使用预训练的稀疏自编码器(SAEs)在激活空间而非权重空间中进行正则化,从而在无需存储先前数据的同时避免灾难性遗忘,并实现了更好的内存效率和更强的基准性能。