Queryable LoRA: 基于指令正则化的共享低秩更新原子路由

Hugging Face Daily Papers 论文

摘要

介绍了一种数据自适应的高效微调方法——Queryable LoRA,它利用共享的低秩更新原子记忆,结合基于注意力的路由和指令正则化,实现动态、上下文敏感的参数更新,同时保持可扩展性。

我们提出了一种数据自适应的方法,用于大神经网络的参数高效微调。标准的低秩适配方法通过将每一层的更新限制为固定的低秩形式来提高效率,但这种静态参数化在适当的修正依赖于输入和网络逐层动态计算时可能过于僵化。我们的方法将纯粹逐层的适配器替换为共享的低秩更新原子可查询记忆。对于每一块层,模型从当前低秩状态和之前块的运行摘要中形成一个查询,通过注意力机制使用该查询检索共享更新组件的与内容相关的组合,并在低秩瓶颈处应用所得的路由算子。这样,该方法保留了低秩适配的效率和可扩展性,同时允许有效更新随输入变化并在层间共享可复用的结构。所得到的架构在静态LoRA风格的更新和完全生成的参数更新之间提供了原则性的中间地带:它保持紧凑和参数高效,同时支持动态、上下文敏感的适配。此外,我们通过使用语言诱导的更新原子先验增强路由logits,从而偏向于选择语义相关方向上的低秩变换,而不会产生无约束的参数更新,从而结合了指令正则化。在含噪声的非线性回归任务和LLM微调上的实验表明,与标准低秩适配相比,这种可查询的更新记忆公式可以在使用相当数量的可训练参数的同时,提高最终的测试性能和训练稳定性。
查看原文
查看缓存全文

缓存时间: 2026/05/12 14:52

论文页面 - Queryable LoRA: 基于指令正则化的共享低秩更新原子路由

来源:https://huggingface.co/papers/2605.08423

摘要

一种用于大型神经网络高效微调的数据自适应方法,利用共享低秩更新原子的记忆库和基于注意力的路由机制,在保持可扩展性的同时实现动态、上下文敏感的参数更新。

我们提出了一种用于大型神经网络的参数高效微调(https://huggingface.co/papers?q=parameter-efficient%20fine-tuning)数据自适应方法。标准的低秩适配(https://huggingface.co/papers?q=low-rank%20adaptation)方法通过将每层更新限制为固定的低秩形式来提高效率,但这种静态参数化在适当校正依赖于输入以及网络逐层深度计算演化时可能过于僵化。我们的方法将纯层局部适配器替换为共享可查询记忆(https://huggingface.co/papers?q=shared%20queryable%20memory)的低秩更新原子。对于每个层块,模型从当前低秩状态和先前块的运行摘要中形成一个查询,利用该查询通过注意力(https://huggingface.co/papers?q=attention)机制检索内容相关的共享更新组件组合,并在低秩瓶颈(https://huggingface.co/papers?q=low-rank%20bottleneck)内应用所得路由算子。这样一来,该方法在保持低秩适配(https://huggingface.co/papers?q=low-rank%20adaptation)效率和可扩展性的同时,使得有效更新能够随输入变化,并能在层间共享可复用结构。由此产生的架构在静态 LoRA 风格更新与全参数生成更新之间提供了一个原则性的中观方案:它既保持紧凑和参数高效,又支持动态、上下文敏感的自适应。此外,我们通过用语言先验(https://huggingface.co/papers?q=language-induced%20prior)增强路由(https://huggingface.co/papers?q=routing)logits 来融入指令正则化(https://huggingface.co/papers?q=instruction-regularization),从而在不产生无约束参数更新的情况下,使低秩变换的选择偏向语义相关的方向。在含噪非线性回归任务和 LLM 微调上的实验表明,与标准低秩适配(https://huggingface.co/papers?q=low-rank%20adaptation)相比,这种可查询更新记忆公式能够在使用相当数量可训练参数(https://huggingface.co/papers?q=trainable%20parameters)的前提下,提升最终测试性能和训练稳定性。

查看 arXiv 页面(https://arxiv.org/abs/2605.08423)查看 PDF(https://arxiv.org/pdf/2605.08423)项目页面(https://neuristemic.ai/queryable-lora/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.08423)

在你的 agent 中获取此论文:

hf papers read 2605.08423

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

没有模型链接本论文

请在模型的 README.md 中引用 arxiv.org/abs/2605.08423 以将其链接到此页面。

引用本论文的数据集0

没有数据集链接本论文

请在数据集的 README.md 中引用 arxiv.org/abs/2605.08423 以将其链接到此页面。

引用本论文的 Space0

没有 Space 链接本论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.08423 以将其链接到此页面。

包含本论文的收藏夹1

相似文章

MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配

arXiv cs.CL

MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。

AdaPreLoRA:Adafactor 预条件低秩适应

Hugging Face Daily Papers

AdaPreLoRA 是一种新颖的 LoRA 优化器,它利用 Adafactor 对角 Kronecker 预条件来改进因子空间更新,同时保持低内存占用,在各种大语言模型(LLM)和任务中表现出具有竞争力的性能。