如果模型只能学习受信任的LoRA适配器所能表达的内容会怎样?[R]
摘要
本研究探讨了将模型的学习限制在仅能学习受信任的LoRA适配器所能表达的内容这一概念,旨在提高微调的安全性和可靠性。
暂无内容
相似文章
LoREnc: 低秩加密用于保护基础模型与LoRA适配器
LoREnc是一个无需训练的框架,通过谱截断与补偿来保护基础模型和LoRA适配器,防止未经授权的模型恢复,同时为授权用户保持性能。已被ICIP 2026录用。
基于可学习秩的参数高效微调
来自阿德莱德大学的研究人员提出了 LR-LoRA(可学习秩 LoRA),这是一种参数高效微调方法,在训练过程中动态学习每个 Transformer 层的适配器秩,而非使用固定的全局秩。LR-LoRA 在语言理解和常识推理基准测试上达到了最先进的性能,超越了固定秩 LoRA 基线。
Compliance2LoRA:通过超网络生成的LoRA适配器在任意策略子集上实现按需安全对齐
Compliance2LoRA提出了一种基于超网络的框架,可为大型推理模型按需生成符合策略的LoRA适配器,从而在无需重新训练单独模型的情况下,实现跨任意策略子集的可调安全对齐。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
CSULoRA: 最接近安全更新的低秩适应
CSULoRA是一种事后方法,用于纠正训练后的LoRA适配器,以在保持实用性的同时保留安全对齐,该方法利用最接近安全更新估计。