如果模型只能学习受信任的LoRA适配器所能表达的内容会怎样?[R]

Reddit r/MachineLearning 论文

摘要

本研究探讨了将模型的学习限制在仅能学习受信任的LoRA适配器所能表达的内容这一概念,旨在提高微调的安全性和可靠性。

暂无内容
查看原文

相似文章

基于可学习秩的参数高效微调

arXiv cs.CL

来自阿德莱德大学的研究人员提出了 LR-LoRA(可学习秩 LoRA),这是一种参数高效微调方法,在训练过程中动态学习每个 Transformer 层的适配器秩,而非使用固定的全局秩。LR-LoRA 在语言理解和常识推理基准测试上达到了最先进的性能,超越了固定秩 LoRA 基线。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。

CSULoRA: 最接近安全更新的低秩适应

arXiv cs.LG

CSULoRA是一种事后方法,用于纠正训练后的LoRA适配器,以在保持实用性的同时保留安全对齐,该方法利用最接近安全更新估计。