LARA:用于冻结的LLMs的小型可组合行为 [P]

Reddit r/MachineLearning 论文

摘要

LARA是一个研究项目和PyTorch库,使用低秩残差适配器为冻结的大型语言模型启用模块化、可组合的行为,允许高效的训练和推理时多种行为的融合。

GitHub: https://github.com/pfekin/LARA 我一直在研究LARA(轻量级加法残差适应),这是一个研究项目,旨在使冻结的语言模型的后训练模块化。我还开发了一个实现它的小型PyTorch库。主要思想是在选定的层训练一个低秩残差适配器,而不是修改模型的权重。产生的行为足够小,可以单独保存,并且可以在推理时加载、移除、融合或路由。行为混合(MoBs)演示可能是理解这在实践中意味着什么的最简单方式。几个独立训练的行为可以共享同一个冻结的模型,一个软路由器在逐个标记的基础上选择或组合它们。例如,一个单一模型可以有单独的编码、数学、医学和总结行为,而不是保留四个单独调整的模型。该存储库还包括与LoRA的比较,以及一些在海明威、菲茨杰拉德和格特鲁德·斯坦因上训练的写作风格行为(第二个演示)。这是一个正在进行的研究项目,但库现在可用,并包含训练代码、示例和复现说明(用于论文)。
查看原文

相似文章

JumpLoRA:大语言模型持续学习的稀疏适配器

arXiv cs.CL

JumpLoRA 引入了一个新颖的稀疏适配器框架,用于大语言模型的持续学习。该方法使用 JumpReLU 门控来动态隔离任务参数并防止灾难性遗忘。它增强了基于 LoRA 的方法,并超越了 ELLA 等最先进的持续学习方法。

TaRA:训练感知的低秩适应初始化

arXiv cs.CL

TaRA是一种针对低秩适应(LoRA)的训练感知初始化方法,它提高了梯度保真度,从而在各种任务中提升了大型语言模型的微调性能。

Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型

Hugging Face Daily Papers

Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。