@techNmak: 每个人都在微调LLM,但几乎没人真正理解模型内部到底在更新什么。以下是5种技术…
摘要
介绍了五种参数高效微调技术:LoRA、LoRA-FA、VeRA、Delta-LoRA和LoRA+,详细说明了每种技术在适配过程中如何修改模型权重。
每个人都在微调LLM。几乎没有人真正理解模型内部实际上在更新什么。这里有5种技术,它们会改变你对模型适配的看法,并揭示每种技术实际上对权重做了什么:
1./ LoRA — 学习更新,而非权重。预训练权重W被冻结,完全不变。不直接更新W,而是训练两个小矩阵 => A ∈ ℝʳˣᵈ 和 B ∈ ℝᵈˣʳ,其中 r ≪ d。权重更新为:ΔW = BA。有效权重:W' = W + BA。整个适配发生在一个极小的低秩空间中,W从未改变。
2./ LoRA-FA — 如果我们冻结更多参数呢?结构与LoRA相同。一处改变:A与W一起被冻结,仅训练B。有效权重:W' = W + BA(A固定)。可训练矩阵数量是LoRA的一半。相同核心思想,更少参数。
3./ VeRA — 如果矩阵根本不需要学习呢?这就变得有趣了。A和B都被冻结,且随机初始化。实际训练的只是两个微小的缩放向量 => b ∈ ℝʳ 和 d ∈ ℝʳ。VeRA不学习低秩矩阵本身,而是保持它们冻结,学习小缩放向量来调节它们的贡献。初始化 => b = 0, d = 1。你学的是如何缩放矩阵,而不是矩阵本身。这是本列表中最参数高效的技术之一。
4./ Delta-LoRA — 如果W本身从低秩更新中学习呢?这从根本上不同。与标准LoRA不同,基础权重W并非完全冻结,而是通过低秩增量传播每一步更新 => W^(t+1) = W^t + c(B_(t+1)A_(t+1) − B_t A_t),其中c是缩放因子。A和B可训练。W会演化,但完全由低秩变化引导。
5./ LoRA+ — 相同结构,更智能的学习率。与LoRA相同:冻结W,训练A和B。一处改变:B被赋予比A更大的学习率。η_B > η_A。A ← A − η_A · ∂J/∂A;B ← B − η_B · ∂J/∂B。一个小的优化改动,可以使LoRA训练更有效。
贯穿所有五种技术的核心思想:适配模型不一定需要全量微调。LoRA更新两个矩阵;LoRA-FA更新一个;LoRA+以不同速度更新两个;Delta-LoRA让W演化——由低秩增量引导;VeRA更新两个向量。相同目标,对同一个问题的五种不同答案:=> 我们实际需要学习的最少内容是什么?这就是参数高效微调背后的核心思想。现在你知道了模型内部实际发生了什么。
相似文章
Qwen3.8-27B-Uncensored-Genesis-V1-GGUF
作者分享了一个修改版的Qwen模型,该模型采用马尔琴科-帕斯图尔分布来蒸馏训练噪声,旨在减少大语言模型 (LLMs) 中过度的token生成,并寻求社区反馈。
@_akhaliq: Unlocking Lossless Speedups in LLMs via Discrete Diffusion 论文: https://huggingface.co/papers/2609.04010…
本文提出了一种使用离散扩散的方法,以在大型语言模型中实现无损加速,旨在提高效率而不影响性能。
@akshay_pachaar: NVIDIA的精彩论文。他们找到了一种使KV缓存可在模型间转移的方法。目标模型跳过预填充…
NVIDIA的论文介绍了一种在LLM模型间传输KV缓存的方法,使目标模型能够跳过预填充,实现比重新处理上下文快2.7到25倍的转换。
OUI-1:全球首款用于 Generative UI 的模型
OUI-1 是全球首款用于 Generative UI 的模型,一个经过微调的 DiffusionGemma,能够以速度和可靠性在消费硬件上生成用户界面。
Show HN:LLM注意力可视化
一款基于React的应用工具,利用Transformers.js可视化大型语言模型中的注意力机制,展示令牌如何影响生成过程,帮助理解LLM行为。