@techNmak: 每个人都在微调LLM,但几乎没人真正理解模型内部到底在更新什么。以下是5种技术…

X AI KOLs Timeline 工具

摘要

介绍了五种参数高效微调技术:LoRA、LoRA-FA、VeRA、Delta-LoRA和LoRA+,详细说明了每种技术在适配过程中如何修改模型权重。

每个人都在微调LLM。几乎没有人真正理解模型内部实际上在更新什么。这里有5种技术,它们会改变你对模型适配的看法,并揭示每种技术实际上对权重做了什么: 1./ LoRA — 学习更新,而非权重。预训练权重W被冻结,完全不变。不直接更新W,而是训练两个小矩阵 => A ∈ ℝʳˣᵈ 和 B ∈ ℝᵈˣʳ,其中 r ≪ d。权重更新为:ΔW = BA。有效权重:W' = W + BA。整个适配发生在一个极小的低秩空间中,W从未改变。 2./ LoRA-FA — 如果我们冻结更多参数呢?结构与LoRA相同。一处改变:A与W一起被冻结,仅训练B。有效权重:W' = W + BA(A固定)。可训练矩阵数量是LoRA的一半。相同核心思想,更少参数。 3./ VeRA — 如果矩阵根本不需要学习呢?这就变得有趣了。A和B都被冻结,且随机初始化。实际训练的只是两个微小的缩放向量 => b ∈ ℝʳ 和 d ∈ ℝʳ。VeRA不学习低秩矩阵本身,而是保持它们冻结,学习小缩放向量来调节它们的贡献。初始化 => b = 0, d = 1。你学的是如何缩放矩阵,而不是矩阵本身。这是本列表中最参数高效的技术之一。 4./ Delta-LoRA — 如果W本身从低秩更新中学习呢?这从根本上不同。与标准LoRA不同,基础权重W并非完全冻结,而是通过低秩增量传播每一步更新 => W^(t+1) = W^t + c(B_(t+1)A_(t+1) − B_t A_t),其中c是缩放因子。A和B可训练。W会演化,但完全由低秩变化引导。 5./ LoRA+ — 相同结构,更智能的学习率。与LoRA相同:冻结W,训练A和B。一处改变:B被赋予比A更大的学习率。η_B > η_A。A ← A − η_A · ∂J/∂A;B ← B − η_B · ∂J/∂B。一个小的优化改动,可以使LoRA训练更有效。 贯穿所有五种技术的核心思想:适配模型不一定需要全量微调。LoRA更新两个矩阵;LoRA-FA更新一个;LoRA+以不同速度更新两个;Delta-LoRA让W演化——由低秩增量引导;VeRA更新两个向量。相同目标,对同一个问题的五种不同答案:=> 我们实际需要学习的最少内容是什么?这就是参数高效微调背后的核心思想。现在你知道了模型内部实际发生了什么。
查看原文

相似文章

Qwen3.8-27B-Uncensored-Genesis-V1-GGUF

Reddit r/LocalLLaMA

作者分享了一个修改版的Qwen模型,该模型采用马尔琴科-帕斯图尔分布来蒸馏训练噪声,旨在减少大语言模型 (LLMs) 中过度的token生成,并寻求社区反馈。

Show HN:LLM注意力可视化

Hacker News Top

一款基于React的应用工具,利用Transformers.js可视化大型语言模型中的注意力机制,展示令牌如何影响生成过程,帮助理解LLM行为。