Queryable LoRA: 基于指令正则化的共享低秩更新原子路由
摘要
介绍了一种数据自适应的高效微调方法——Queryable LoRA,它利用共享的低秩更新原子记忆,结合基于注意力的路由和指令正则化,实现动态、上下文敏感的参数更新,同时保持可扩展性。
查看缓存全文
缓存时间: 2026/05/12 14:52
论文页面 - Queryable LoRA: 基于指令正则化的共享低秩更新原子路由
来源:https://huggingface.co/papers/2605.08423
摘要
一种用于大型神经网络高效微调的数据自适应方法,利用共享低秩更新原子的记忆库和基于注意力的路由机制,在保持可扩展性的同时实现动态、上下文敏感的参数更新。
我们提出了一种用于大型神经网络的参数高效微调(https://huggingface.co/papers?q=parameter-efficient%20fine-tuning)数据自适应方法。标准的低秩适配(https://huggingface.co/papers?q=low-rank%20adaptation)方法通过将每层更新限制为固定的低秩形式来提高效率,但这种静态参数化在适当校正依赖于输入以及网络逐层深度计算演化时可能过于僵化。我们的方法将纯层局部适配器替换为共享可查询记忆(https://huggingface.co/papers?q=shared%20queryable%20memory)的低秩更新原子。对于每个层块,模型从当前低秩状态和先前块的运行摘要中形成一个查询,利用该查询通过注意力(https://huggingface.co/papers?q=attention)机制检索内容相关的共享更新组件组合,并在低秩瓶颈(https://huggingface.co/papers?q=low-rank%20bottleneck)内应用所得路由算子。这样一来,该方法在保持低秩适配(https://huggingface.co/papers?q=low-rank%20adaptation)效率和可扩展性的同时,使得有效更新能够随输入变化,并能在层间共享可复用结构。由此产生的架构在静态 LoRA 风格更新与全参数生成更新之间提供了一个原则性的中观方案:它既保持紧凑和参数高效,又支持动态、上下文敏感的自适应。此外,我们通过用语言先验(https://huggingface.co/papers?q=language-induced%20prior)增强路由(https://huggingface.co/papers?q=routing)logits 来融入指令正则化(https://huggingface.co/papers?q=instruction-regularization),从而在不产生无约束参数更新的情况下,使低秩变换的选择偏向语义相关的方向。在含噪非线性回归任务和 LLM 微调上的实验表明,与标准低秩适配(https://huggingface.co/papers?q=low-rank%20adaptation)相比,这种可查询更新记忆公式能够在使用相当数量可训练参数(https://huggingface.co/papers?q=trainable%20parameters)的前提下,提升最终测试性能和训练稳定性。
查看 arXiv 页面(https://arxiv.org/abs/2605.08423)查看 PDF(https://arxiv.org/pdf/2605.08423)项目页面(https://neuristemic.ai/queryable-lora/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.08423)
在你的 agent 中获取此论文:
hf papers read 2605.08423
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
没有模型链接本论文
请在模型的 README.md 中引用 arxiv.org/abs/2605.08423 以将其链接到此页面。
引用本论文的数据集0
没有数据集链接本论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.08423 以将其链接到此页面。
引用本论文的 Space0
没有 Space 链接本论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.08423 以将其链接到此页面。
包含本论文的收藏夹1
相似文章
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。
MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
学习选择,而非重新学习:推理LoRA的硬路由混合
提出了Hard-Routed MoR-LoRA,一种两阶段框架,通过硬top-1路由组合冻结的推理LoRA专家,相比软路由基线,在保留专家行为的同时需要更少的可训练参数。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
AdaPreLoRA:Adafactor 预条件低秩适应
AdaPreLoRA 是一种新颖的 LoRA 优化器,它利用 Adafactor 对角 Kronecker 预条件来改进因子空间更新,同时保持低内存占用,在各种大语言模型(LLM)和任务中表现出具有竞争力的性能。