标签
CORAM 提出了一种用于模型合并的一致正交旋转方法,该方法将权重矩阵分割为行切片,在基础模型的帧中使用奇异值分解(SVD),并在流形上合并更新,以提高现有技术的准确性。
本文研究了LoRA中的奇异分量,并提出SCLoRA,一种使用光谱裁剪来提高任务自适应能力同时减少预训练知识灾难性遗忘的方法。
本文提出通过按列分块的SVD直接从线性权重位点提取机制挂载,为机械可解释性提供了一种替代稀疏自编码器等代理字典的方法。在Gemma-2-2B上评估,该方法通过了全部182项位点-层检查。
This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.
本文提出了一种通过结合神经元重要性和数据感知低秩逼近来压缩大型语言模型的方法,同时采用高效的动态压缩率分配算法,性能与之前的最先进水平相当或更优。
LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF,这是 Qwen 模型的一个修改版本,使用 Genesis 后训练算法通过自定义 SVD 对 GGUF 格式张量进行信号纯度修复和噪声降低。
KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。
LACE-SVD是一种新颖的大语言模型低秩压缩方法,采用损失感知的秩分配策略和传播感知的纠正技术,以减轻残差流中的累积误差传播,在高压缩比下实现了比以往基于SVD的方法更好的困惑度。
这篇博客文章从头开始解释了如何推导奇异值分解(SVD),重点强调了背后的直觉和概念动机,认为传统的数学书籍往往只呈现形式化的结论,而没有展示探索的过程。
本文介绍了低成本高阶奇异值分解(lcHOSVD),一种基于张量的方法,用于从稀疏传感器测量中重构高维环境场。应用于城市流动和空气质量数据集,与基于矩阵的方法相比,该方法实现了更低的重构误差,并对不均匀传感器分布具有更强的鲁棒性。
该研究揭示了LLM文本嵌入被高频token(如句号、冠词)绑架的问题,提出EmbedFilter方法通过对unembedding矩阵进行SVD分解并减去投影分量来释放真实语义,实现零训练开销的降维和检索效率提升。
Sebastian Raschka 指出,从 LatentMoE 到特征分解的灵感链:MLA、LoRA 和 SVD 层层启发。
一种后验方法通过截断权重更新矩阵SVD的尾部来减少微调大语言模型中的虚假相关性。该方法在不重新训练或使用群体标签的情况下,将虚假群体差距最多减少5倍,精度损失小于2个百分点。
介绍SigmaScale,一种为基于SVD的LLM压缩学习辅助缩放矩阵的方法,在Llama 3.1 8B和Qwen3-8B基准测试上展现出具有竞争力的性能。
本文提出DG-Hard,一种事后谱修复方法,仅使用预训练和微调检查点,即可恢复因微调而受损的能力,无需重新训练。该方法将Donoho-Gavish硬奇异值阈值应用于权重更新,去除噪声并恢复退化的性能。
本文介绍了 CERSA,这是一种新颖的参数高效微调方法,它利用奇异值分解来保留主成分,在显著降低内存使用的同时,其表现优于 LoRA 等现有方法。