quantization

标签

Cards List
#quantization

内存高效的表格基础模型

arXiv cs.LG · 2026-07-31 缓存

本文研究了TabPFN等表格基础模型的内存需求,并表明模型压缩(如INT4量化)可以将内存占用减少高达7.6倍,且精度损失极小,从而提升实际部署效率。

0 人收藏 0 人点赞
#quantization

分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG · 2026-07-31 缓存

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。

0 人收藏 0 人点赞
#quantization

有人测试过 IQ1_M 342GB 剪枝版 Kimi K3 吗?能用吗?

Reddit r/LocalLLaMA · 2026-07-30 缓存

这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。

0 人收藏 0 人点赞
#quantization

HiFloat4格式:用于大型语言模型端到端强化学习后训练

arXiv cs.LG · 2026-07-30 缓存

本文提出了HiFloat4格式和Rollout-ResQ,用于LLM的端到端FP4强化学习后训练,在Qwen2.5模型上实现了与BF16相比仅1.1%的准确率差距。

0 人收藏 0 人点赞
#quantization

有人试过Q1 Kimi K3吗?(555GB)

Reddit r/LocalLLaMA · 2026-07-29 缓存

Kimi K3是一个庞大的2.9万亿参数混合专家模型,拥有1040亿活跃参数,100万上下文长度,原生支持MXFP4训练,现已提供从540GB到更小尺寸的GGUF量化版本,但运行需要强大的硬件。

0 人收藏 0 人点赞
#quantization

我在一台6GB RTX 4050笔记本上尝试运行1.56TB MoE模型,结果如下

Reddit r/LocalLLaMA · 2026-07-29

在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。

0 人收藏 0 人点赞
#quantization

GPTQ-2D:三次时间复杂度的双边自适应舍入

Hugging Face Daily Papers · 2026-07-29 缓存

本文介绍了GPTQ-2D,一种双边自适应舍入方法,其产生的结果与在向量化矩阵上应用GPTQ相同,但运行时间复杂度从四次方降为三次方。

0 人收藏 0 人点赞
#quantization

Laguna S 2.1 GGUF Q4_K_M 从 68GB 增加到 96GB?

Reddit r/LocalLLaMA · 2026-07-28

用户注意到 Laguna S 2.1 的 Q4_K_M 量化版本从 68GB 增加到了 96GB,可能是因为使用了更多的 FP16 层,并讨论了量化与上下文循环可能存在的问题。

0 人收藏 0 人点赞
#quantization

我构建了一个工具,在量化前实际测试哪些权重重要,而不是靠猜测(Qwen3.6-27B,三个版本:Bedrock/Tightrope/Gambit)

Reddit r/LocalLLaMA · 2026-07-28

一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。

0 人收藏 0 人点赞
#quantization

microsoft/VibeVoice-ASR-BitNet

Reddit r/LocalLLaMA · 2026-07-28 缓存

Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。

0 人收藏 0 人点赞
#quantization

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG · 2026-07-28 缓存

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。

0 人收藏 0 人点赞
#quantization

相同的预测,不同的原因:量化对模型解释的影响

arXiv cs.LG · 2026-07-28 缓存

本文系统评估了后训练量化如何影响使用Grad-CAM和LIME的CNN模型的可解释性,揭示分类准确性并非可解释性稳定性的可靠指标,并且架构选择对于可信部署至关重要。

0 人收藏 0 人点赞
#quantization

QFedPolyp:一种通信与推理高效的联邦学习框架用于息肉分割

arXiv cs.LG · 2026-07-28 缓存

QFedPolyp 提出了一种用于息肉分割的联邦学习框架,该框架利用量化感知训练来降低通信成本并实现更快的推理,同时保护隐私。

0 人收藏 0 人点赞
#quantization

在AMD 6800H(iGPU/UMA)上测试Gemma 4和Qwen 3.6 MoE——性能解析

Reddit r/LocalLLaMA · 2026-07-27

在AMD 6800H iGPU上使用llama.cpp Vulkan后端对Gemma 4和Qwen 3.6 MoE模型进行的基准测试表明,MoE模型和低位量化(Q4_0)提供了最佳性能,而Q8_0对于大型模型来说速度太慢。

0 人收藏 0 人点赞
#quantization

Kimi K3 权重今天发布。我们本周将在A100、H200和B300上部署,而A100的内存需求已经显得很紧张了

Reddit r/LocalLLaMA · 2026-07-27

Kimi K3 权重今日发布。该模型拥有2.8万亿参数、MoE架构(896个专家)、100万上下文、视觉能力以及MXFP4量化。在A100和H200上部署需要多节点,但单个B300节点即可容纳。预计本周末将公布各GPU配置下的tok/s、ttft及每百万token成本等基准数据。

0 人收藏 0 人点赞
#quantization

Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s

Reddit r/LocalLLaMA · 2026-07-27

Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。

0 人收藏 0 人点赞
#quantization

Qwen 3.6 27B 的量化是否会破坏 pelican?

Reddit r/LocalLLaMA · 2026-07-27 缓存

本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。

0 人收藏 0 人点赞
#quantization

Qwen3.6-27B 推测解码在更大量化下性能提升

Reddit r/LocalLLaMA · 2026-07-27

Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。

0 人收藏 0 人点赞
#quantization

Kat Coder 2.5 简直不可思议,尤其是我还在 Q4_K_M 量化下运行它。

Reddit r/LocalLLaMA · 2026-07-27

Kat Coder 2.5 是一款编程助手模型,即使在 Q4_K_M 量化下运行,也能表现出令人印象深刻的性能。

0 人收藏 0 人点赞
#quantization

BeeLlama.cpp v0.4.1:KVarN、KV精度尾部、q2_0-q3_1 KV缓存,改进支持。KLD基准测试:尾部1024使kvarn5和q6_0匹配q8_0,且显存占用大幅降低

Reddit r/LocalLLaMA · 2026-07-26

BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈