基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers 论文

摘要

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。

将事实知识可靠且大规模地注入大语言模型仍然是一个开放的挑战。超网络为大规模知识注入提供了一种有前景的解决方案。尽管超网络通常用于测试时自适应,但我们探索其在训练时知识注入中的应用:给定一个大型事实语料库,我们训练一个超网络生成固定的LoRA适配器,当将其插入目标模型时,能使模型回答关于这些事实的问题。在这项工作中,我们研究了超网络是否可用于执行训练时知识注入,以及这种能力如何随规模变化。超网络的缩放行为在很大程度上尚未被研究。我们的设计将超网络的注入能力与目标模型的通用能力解耦,从而首次实现了对超网络架构缩放定律的严谨研究。我们刻画了损失、推理准确率和分布外(OOD)泛化如何随超网络深度、宽度以及目标网络大小变化。我们构建了一个大规模数据集MegaWikiQA,包含来自Wikidata5M示例构建的39个领域的数千万个多跳问答样本。我们的结果表明:(i)基于超网络的注入在所有架构维度上表现出广泛可预测的幂律缩放;(ii)超网络在规模增大时能够实现可靠的分布外泛化,这表明超网络是其他训练时自适应方法(如LoRA微调和全参数微调)的一种有前景的替代方案,在所有分布外评估中展现出更陡峭的缩放指数。这些结果共同确立了超网络作为训练时自适应的有原则且可扩展的基础,并首次提供了经验支持的缩放定律,以指导超网络在大语言模型中进行事实推理。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:07

论文页面 - 基于超网络的知识注入在大语言模型中的缩放定律

来源:https://huggingface.co/papers/2607.19604

摘要

将事实知识可靠且大规模地注入大语言模型(LLMs)仍是一个开放挑战。超网络为大规模知识注入提供了一种有前景的解决方案。尽管超网络通常用于测试时自适应,但我们探索其在训练时知识注入中的应用:给定一个包含大量事实的语料库,我们训练一个超网络来生成固定的LoRA适配器,将其插入目标模型后,模型能够回答关于这些事实的问题。在这项工作中,我们研究超网络是否可用于执行训练时知识注入,以及这种能力如何随规模变化。超网络的缩放行为在很大程度上尚未被研究。我们的设计将超网络的注入容量与目标模型的通用能力解耦,从而首次能够对超网络架构进行严格的缩放定律研究。我们描述了损失、推理准确性和分布外(OOD)泛化如何随超网络深度、宽度和目标网络大小而变化。我们构建了一个大规模数据集MegaWikiQA,包含从Wikidata5M示例中构建的跨越39个领域的数千万个多跳问答示例。我们的结果揭示:(i) 基于超网络的知识注入在所有架构轴上表现出广泛的预测性幂律缩放;(ii) 超网络在规模增大时能够实现可靠的OOD泛化,这表明超网络为其他训练时自适应方法(如LoRA微调和全微调)提供了一种有前景的替代方案,在所有OOD评估中表现出更陡峭的缩放指数。综合这些结果,超网络被确立为一种有原则且可扩展的训练时自适应基板,并提供了首个基于经验的缩放定律,用于指导大语言模型中进行事实推理的超网络。

查看arXiv页面 (https://arxiv.org/abs/2607.19604)查看PDF (https://arxiv.org/pdf/2607.19604)项目页面 (https://www.nace.ai/research/scaling-law-for-hypernetwork)GitHub13 (https://github.com/hdnndh/Latent-Geometry-Beyond-Search-Amortizing-Planning-in-World-Models)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19604)

在您的代理中获取此论文:

hf papers read 2607.19604

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.19604 以从此页面链接。

引用此论文的数据集0

无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.19604 以从此页面链接。

引用此论文的 Spaces0

无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.19604 以从此页面链接。

收藏此论文的集合2

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

大语言模型中的模型合并扩展定律

Hugging Face Daily Papers

本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。