标签
本研究提出了一种新的对抗训练方法,利用低秩Householder展开消除输入梯度需求,从而在降低计算成本的同时,实现与标准技术在小扰动条件下相当的鲁棒性。
LoRA-Diffusion 提出了一种针对扩散语言模型的参数高效微调方法,通过对去噪轨迹而非模型权重进行低秩分解,仅使用 1.2% 的轨迹适配器参数即可获得具有竞争力的性能。
本文介绍了语言条件反量化(LCD),一种事后方法,向已量化的LLM添加每种语言的低秩LoRA修正,以恢复因英语校准量化而丢失的多语言性能,并在非英语语言上显示出显著的困惑度和准确率提升。
本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。
AuroSFT introduces a parameter-efficient adapter-based framework for multi-task supervised fine-tuning that rolls back adapter checkpoints at task-wise peaks instead of full-model checkpoints, achieving higher average accuracy than mSFT.
ARCHead 是一种紧凑的 LM-head 压缩器,结合了量化低秩因子、INT4 残差和激活度量校正,在保持困惑度的同时将存储减少约 3.7–3.9 倍,作为现有块量化器的补充。
This paper introduces S4R, a low-rank KV cache compression method that combines selective token sampling, subspace construction, and sparse reconstruction to achieve up to 5× compression with near full-cache accuracy on LongBench and RULER benchmarks.
本文表明,轻度压缩的大语言模型能够通过标准的无数据质量门禁(困惑度、MMLU、输出保真度),但在用作智能体时仍会编造程序步骤,并提出一种无数据双轴筛查方法,以便在部署前检测此类失败。
This paper proposes CoRA, a gradient-free framework for task-conditioned retrieval in on-device in-context learning, using frozen encoders and closed-form ridge regression to build compact retrieval bases without fine-tuning or backpropagation.
本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。
介绍VarRate,一种无训练的KV缓存压缩方法,根据查询显著性为每个令牌分配可变低秩预算,避免了不可逆的令牌驱逐,并且在LongBench上以匹配的内存预算优于均匀秩方法。
提出FedKAD,一种面向物联网系统中多变量时间序列的联邦Koopman异常检测框架,采用轻量级滑动窗口Koopman表示和Stiefel-ADMM算法实现高效通信和推理。
KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。
LACE-SVD是一种新颖的大语言模型低秩压缩方法,采用损失感知的秩分配策略和传播感知的纠正技术,以减轻残差流中的累积误差传播,在高压缩比下实现了比以往基于SVD的方法更好的困惑度。
本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。
引入重复隐式残差(DLR),这是一种仅训练、无参数的插件,用于低秩预训练,可提升从60M到7B参数的LLaMA模型的困惑度,并且训练后可折叠到模型中,推理成本为零。
本文提出了矩阵补全问题的一种分布性推广,其中每个条目是概率分布而非标量,利用核均值嵌入和Tucker秩来捕捉低秩结构。作者提出了一种新的估计器,并给出了非渐近误差界,通过在合成数据和真实世界数据上的实验证明了该方法的有效性。
介绍了一种名为 Eggroll 的低秩进化策略,用于脉冲神经网络的无梯度训练,在 N-MNIST 上减少内存和时间开销,同时达到有竞争力的准确率。
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。