@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…

X AI KOLs Following 论文

摘要

来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。

来自@NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识。 该研究推进了一个关键的持续学习目标:在不直接干扰现有参数的情况下教模型新事实。 即,该方法可能减少每次知识变化时反复调整数十亿基础模型参数的需求。 核心思想是,一个模型可以学习如何为另一个模型制造知识更新。 基础模型的权重从不移动,但会在其旁边添加额外的低秩矩阵。这些矩阵携带注入的信息,并将模型的内部计算重定向到支持事实的答案。 这里的知识注入变成了一个可重复使用的过程,而不是针对每个事实语料库进行单独的微调。 该方法将存储新事实与改变必须推理这些事实的语言模型分离开来。 冻结的语言模型可以通过生成的适配器吸收新知识,同时保留其原始参数。 超网络就像一个编译器,将事实转换为另一个模型内部的临时变化。 最强的结果是,随着目标语言模型变大,这些生成的更新泛化能力更好。
查看原文
查看缓存全文

缓存时间: 2026/07/24 15:12

来自@NaceAI的新论文展示了一种在不重写语言模型核心参数的情况下添加大量知识库的可行方法。

该研究推动了一个关键的持续学习目标:在不直接干扰模型现有参数的前提下,向其传授新知识。

也就是说,这种方法可以减少在知识发生变化时反复调整数十亿基础模型参数的需求。

其核心思想是:一个模型可以学会如何为另一个模型制造知识更新。

基础模型的权重始终不变,但在其旁边添加了额外的低秩矩阵。这些矩阵承载注入的信息,并将模型的内部计算引导至符合事实支持的答案。

在这里,知识注入变成了一种可复用的过程,而不是针对每个事实语料库分别进行微调。

该方法将存储新事实与改变必须基于这些事实进行推理的语言模型分离开来。

一个冻结的语言模型可以通过生成的适配器吸收新知识,同时保留其原始参数。

超网络充当一种编译器,将事实转化为另一个模型内部的临时变更。

最强的结果是:当目标语言模型变得更大时,这些生成的更新泛化能力也更强。

Nace AI (@NaceAI): Nace AI 研究团队发布关于超网络的新研究成果。推出 📄《基于超网络的大语言模型知识注入的缩放定律》。

arXiv 预印本:https://t.co/GnKbd2hUVH 更多信息:

相似文章

基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。