标签
本文研究了TabPFN等表格基础模型的内存需求,并表明模型压缩(如INT4量化)可以将内存占用减少高达7.6倍,且精度损失极小,从而提升实际部署效率。
本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。
这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。
本文提出了HiFloat4格式和Rollout-ResQ,用于LLM的端到端FP4强化学习后训练,在Qwen2.5模型上实现了与BF16相比仅1.1%的准确率差距。
Kimi K3是一个庞大的2.9万亿参数混合专家模型,拥有1040亿活跃参数,100万上下文长度,原生支持MXFP4训练,现已提供从540GB到更小尺寸的GGUF量化版本,但运行需要强大的硬件。
在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。
本文介绍了GPTQ-2D,一种双边自适应舍入方法,其产生的结果与在向量化矩阵上应用GPTQ相同,但运行时间复杂度从四次方降为三次方。
用户注意到 Laguna S 2.1 的 Q4_K_M 量化版本从 68GB 增加到了 96GB,可能是因为使用了更多的 FP16 层,并讨论了量化与上下文循环可能存在的问题。
一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。
Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
本文系统评估了后训练量化如何影响使用Grad-CAM和LIME的CNN模型的可解释性,揭示分类准确性并非可解释性稳定性的可靠指标,并且架构选择对于可信部署至关重要。
QFedPolyp 提出了一种用于息肉分割的联邦学习框架,该框架利用量化感知训练来降低通信成本并实现更快的推理,同时保护隐私。
在AMD 6800H iGPU上使用llama.cpp Vulkan后端对Gemma 4和Qwen 3.6 MoE模型进行的基准测试表明,MoE模型和低位量化(Q4_0)提供了最佳性能,而Q8_0对于大型模型来说速度太慢。
Kimi K3 权重今日发布。该模型拥有2.8万亿参数、MoE架构(896个专家)、100万上下文、视觉能力以及MXFP4量化。在A100和H200上部署需要多节点,但单个B300节点即可容纳。预计本周末将公布各GPU配置下的tok/s、ttft及每百万token成本等基准数据。
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
Kat Coder 2.5 是一款编程助手模型,即使在 Q4_K_M 量化下运行,也能表现出令人印象深刻的性能。
BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。