基于超网络的大语言模型知识注入的缩放定律
摘要
本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。
查看缓存全文
缓存时间: 2026/07/24 05:07
论文页面 - 基于超网络的知识注入在大语言模型中的缩放定律
来源:https://huggingface.co/papers/2607.19604
摘要
将事实知识可靠且大规模地注入大语言模型(LLMs)仍是一个开放挑战。超网络为大规模知识注入提供了一种有前景的解决方案。尽管超网络通常用于测试时自适应,但我们探索其在训练时知识注入中的应用:给定一个包含大量事实的语料库,我们训练一个超网络来生成固定的LoRA适配器,将其插入目标模型后,模型能够回答关于这些事实的问题。在这项工作中,我们研究超网络是否可用于执行训练时知识注入,以及这种能力如何随规模变化。超网络的缩放行为在很大程度上尚未被研究。我们的设计将超网络的注入容量与目标模型的通用能力解耦,从而首次能够对超网络架构进行严格的缩放定律研究。我们描述了损失、推理准确性和分布外(OOD)泛化如何随超网络深度、宽度和目标网络大小而变化。我们构建了一个大规模数据集MegaWikiQA,包含从Wikidata5M示例中构建的跨越39个领域的数千万个多跳问答示例。我们的结果揭示:(i) 基于超网络的知识注入在所有架构轴上表现出广泛的预测性幂律缩放;(ii) 超网络在规模增大时能够实现可靠的OOD泛化,这表明超网络为其他训练时自适应方法(如LoRA微调和全微调)提供了一种有前景的替代方案,在所有OOD评估中表现出更陡峭的缩放指数。综合这些结果,超网络被确立为一种有原则且可扩展的训练时自适应基板,并提供了首个基于经验的缩放定律,用于指导大语言模型中进行事实推理的超网络。
查看arXiv页面 (https://arxiv.org/abs/2607.19604)查看PDF (https://arxiv.org/pdf/2607.19604)项目页面 (https://www.nace.ai/research/scaling-law-for-hypernetwork)GitHub13 (https://github.com/hdnndh/Latent-Geometry-Beyond-Search-Amortizing-Planning-in-World-Models)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19604)
在您的代理中获取此论文:
hf papers read 2607.19604
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.19604 以从此页面链接。
引用此论文的数据集0
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.19604 以从此页面链接。
引用此论文的 Spaces0
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.19604 以从此页面链接。
收藏此论文的集合2
相似文章
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
InfoLaw:基于质量加权混合数据与重复度的大型语言模型信息缩放定律
InfoLaw 是一种数据感知型缩放框架,能够根据 token 消耗量、模型规模、数据混合权重及重复度预测模型损失,从而在不同算力预算下实现高效的数据配方选择。
大语言模型中的模型合并扩展定律
本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。
@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…
来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。
从机制上理解大语言模型微调中记忆知识无法泛化的原因
本文形式化了大语言模型微调中的“知道-使用鸿沟”,即模型记忆事实但无法泛化。引入了自修补干预方法,并确定知识回路错位为根本原因,通过简单启发式方法恢复了58-75%的泛化失败。