model-compression

标签

Cards List
#model-compression

在 500MB 内存上运行 Gemma 4

Reddit r/LocalLLaMA · 5天前

讨论了如何在仅有 500MB 内存的设备上运行 Gemma 4,可能通过量化或其他优化技术实现。

0 人收藏 0 人点赞
#model-compression

千字节模型:神经网络作为种子与量化潜向量

arXiv cs.LG · 5天前 缓存

本文介绍了“千字节模型”,一种极端压缩范式,其中神经网络权重从种子和量化潜向量重新生成,利用映射网络和分块种子基将存储减少到千字节级别。

0 人收藏 0 人点赞
#model-compression

SparseKAN: Compressing Kolmogorov--Arnold Networks Across Basis Functions, Neurons, and Bits

arXiv cs.LG · 5天前 缓存

SparseKAN is a unified compression method for Kolmogorov–Arnold Networks that prunes basis functions, neurons, and numerical precision under learnable gates, achieving up to 73% parameter reduction and significant latency improvements on software and FPGA hardware.

0 人收藏 0 人点赞
#model-compression

Progressive$^2$:一种用于大幅模型压缩的师生渐进协同进化知识蒸馏方法

arXiv cs.LG · 5天前 缓存

提出Progressive$^2$,一种师生渐进协同进化的知识蒸馏方法,用于大幅模型压缩,解决服务器与客户端能力之间巨大差距的问题。引入了渐进式教师层选择和学生规模缩减,并配备多特征融合适配器。

0 人收藏 0 人点赞
#model-compression

Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型

Hugging Face Daily Papers · 5天前 缓存

Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。

0 人收藏 0 人点赞
#model-compression

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

arXiv cs.LG · 6天前 缓存

This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.

0 人收藏 0 人点赞
#model-compression

@pallavishekhar_: 知识蒸馏是如何工作的?在此阅读:https://outcomeschool.com/blog/how-does-knowledge-distillation-work…

X AI KOLs Timeline · 2026-07-31 缓存

一篇教育性的博客文章,解释了知识蒸馏的工作原理,涵盖教师-学生框架、软标签、温度和蒸馏损失,并附有实际示例。

0 人收藏 0 人点赞
#model-compression

内存高效的表格基础模型

arXiv cs.LG · 2026-07-31 缓存

本文研究了TabPFN等表格基础模型的内存需求,并表明模型压缩(如INT4量化)可以将内存占用减少高达7.6倍,且精度损失极小,从而提升实际部署效率。

0 人收藏 0 人点赞
#model-compression

TriSP: 三信号结构化剪枝用于大语言模型

arXiv cs.AI · 2026-07-28 缓存

TriSP 提出了一种三信号重要性度量,结合权重幅度、激活范数和梯度敏感性,用于大语言模型的结构化剪枝,在 LLaMA-7B 上实现了最低困惑度和高吞吐量提升。

0 人收藏 0 人点赞
#model-compression

面向延迟和模型大小优化的LLM多目标结构化剪枝

arXiv cs.AI · 2026-07-28 缓存

提出了一种面向LLM的两阶段结构化剪枝框架,通过多目标深度剪枝和并行贝叶斯优化联合优化延迟与模型大小,在边缘部署中实现有利的权衡。

0 人收藏 0 人点赞
#model-compression

CausalGate: 因果重要性蒸馏用于Transformer模块剪枝

arXiv cs.LG · 2026-07-28 缓存

CausalGate引入了一种方法,通过因果干预测量Transformer子层的重要性,并将其蒸馏为静态标量门控,实现高效推理且无运行时开销,优于现有的剪枝和路由方法。

0 人收藏 0 人点赞
#model-compression

我想在家跑Kimi K3,所以正尝试让2.8T规模的实验更便宜

Reddit r/LocalLLaMA · 2026-07-27

一位退休工程师提出了蓝图蒸馏(BPD)方法,将昂贵的教师分析与学生压缩分离,适用于Kimi K3等大型MoE模型,从而允许复用压缩蓝图来生成多种规模的学生模型。

0 人收藏 0 人点赞
#model-compression

神经特征治理:扩展原子盛行度

arXiv cs.LG · 2026-07-27 缓存

本文介绍了Neural Atom Prevalence(NAP),一种用于结构化节点级模型选择的贝叶斯框架,该框架在神经网络中实现了高稀疏性、高准确性和不确定性量化。

0 人收藏 0 人点赞
#model-compression

突破压缩瓶颈:从理论到实践

arXiv cs.CL · 2026-07-24 缓存

本文首次从数学上证明,低秩分解与量化在结合用于LLM压缩时并非正交,会导致性能下降,并提出了一种新颖的对角粘合方法(DAM)来减轻这种损失。

0 人收藏 0 人点赞
#model-compression

会话自适应正交蒸馏(SAOD)技术将744B(1.5TB)压缩至100GB以下?

Reddit r/LocalLLaMA · 2026-07-22

会话自适应正交蒸馏(SAOD)是一种将7440亿参数模型(1.5TB)压缩至100GB以下的技术,大幅降低存储和推理成本。

0 人收藏 0 人点赞
#model-compression

@akshay_pachaar: 如果必须将70B模型适配到单个GPU上,我会学习的LLM量化技术:(收藏此帖) FP16的70B模型……

X AI KOLs Following · 2026-07-22 缓存

一条推文介绍了五种关键的LLM量化技术(RTN, GPTQ, AWQ, LLM.int8(), QAT),用于在有限硬件上适配大型模型,并引用了一篇综合性研究论文。

0 人收藏 0 人点赞
#model-compression

@rohanpaul_ai:Meta的论文显示,量化推理模型常常因为反复怀疑正确答案而非完成推理而失败…

X AI KOLs Following · 2026-07-22 缓存

Meta的论文表明,量化推理模型常常失败,因为压缩使它们对正确答案产生怀疑,但通过对“wait”或“but”等犹豫词施加轻微惩罚,可以将推理长度缩短12-23%,同时保持或提高准确性。

0 人收藏 0 人点赞
#model-compression

超越单维压缩:大语言模型的复合稀疏前沿

arXiv cs.LG · 2026-07-22 缓存

本文提出了一种针对LLM的复合稀疏框架,结合了静态参数剪枝与动态令牌级计算,表明混合这两种机制优于单维压缩,并能延迟性能退化。

0 人收藏 0 人点赞
#model-compression

在微控制器上运行13M参数的ASR Conformer模型

Reddit r/LocalLLaMA · 2026-07-20

详细介绍了一种在微控制器上直接运行拥有13M参数的ASR Conformer模型的方法,突出了边缘AI部署的进步。

0 人收藏 0 人点赞
#model-compression

减少模型参数大小?

Reddit r/LocalLLaMA · 2026-07-20

讨论减少模型参数大小的方法或研究,可能侧重于剪枝或量化等技术以提高效率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈