quantization

标签

Cards List
#quantization

MiCoPro:基于硬件感知代理模型的端到端混合精度软硬件协同设计

arXiv cs.LG · 5小时前 缓存

MiCoPro 提出了一种用于混合精度量化的端到端软硬件协同设计框架,利用硬件感知代理模型在延迟约束下搜索最优的逐层位宽,并直接部署到边缘硬件,在准确率下降不到3%的情况下,实现了最高40%的延迟降低。

0 人收藏 0 人点赞
#quantization

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG · 5小时前 缓存

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。

0 人收藏 0 人点赞
#quantization

Quantization Damage Is Multiplicative, Not Additive

arXiv cs.LG · 5小时前 缓存

This preprint challenges the common assumption that quantization damage is additive noise, showing instead that it multiplies decision margins and shrinks them with bit-width, leading to silent failures in tool-use and safety decisions. The authors propose a fitted multiplicative model that predicts flip rates well.

0 人收藏 0 人点赞
#quantization

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

arXiv cs.AI · 5小时前 缓存

ReQuant introduces a backpropagation-free, fixed-grid discrete refinement stage for post-training quantization (PTQ) that iteratively improves initial quantized models while preserving the quantized format, showing consistent gains across various LLMs and bit-widths.

0 人收藏 0 人点赞
#quantization

KLQ: Training-free measured rotation quantization. Beats all training-free rotation-based quantization methods on W4A4KV4-bits. Llama 3.2 1B KLQ-quantized beats SpinQuant and gets close to ReSpinQuant without GPTQ/LDLQ rounding.

Reddit r/LocalLLaMA · 11小时前 缓存

KLQ is a training-free LLM quantization method that allocates bits per direction based on measured KL divergence, outperforming existing training-free rotation-based methods on W4A4KV4-bit settings for models like Llama 3.2 1B and Qwen 2.5.

0 人收藏 0 人点赞
#quantization

[2606.05682] 超越输出匹配:在NVFP4 LLM蒸馏中保持内部几何结构

Reddit r/LocalLLaMA · 12小时前 缓存

本文研究了针对NVFP4低精度大语言模型的量化感知蒸馏,并发现仅使用KL损失的输出匹配可能掩盖内部表征漂移。作者提出了CKA-QAD,通过CKA引导的对齐来保持内部几何结构,从而提升了紧凑模型在推理和编码任务上的准确性。

0 人收藏 0 人点赞
#quantization

更新基准测试:DeepSeek V4 Flash 在 SlopCodeBench(本地)上的表现

Reddit r/LocalLLaMA · 昨天

用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。

0 人收藏 0 人点赞
#quantization

我在ESP32 Dev Kit V1上运行了完整的LLM模型(仅用81KB内存)

Reddit r/ArtificialInteligence · 昨天

一位开发者成功在ESP32 Dev Kit V1上运行了量化至INT4的520万参数MoE LLM,仅使用81KB SRAM,通过从闪存流式加载专家,实现了约每秒5个token的速度。

0 人收藏 0 人点赞
#quantization

Kimi K3 (Unsloth) IQ2-XXS 从 711GB 降至 478GB!!! 仅移除多语言来缩减体积

Reddit r/LocalLLaMA · 昨天

Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。

0 人收藏 0 人点赞
#quantization

目前理论上的 LLM 量化最佳位宽是什么?[D]

Reddit r/MachineLearning · 2天前

一个讨论性问题,询问在固定内存预算下 LLM 量化的理论最佳位宽,并引用了 2025-2026 年关于 3-bit/2-bit 结果和缩放定律的研究。

0 人收藏 0 人点赞
#quantization

llama.cpp PR 报告:仅切换一个 SYCL 内核,Intel Battlemage 上量化 KV 解码在 118K 上下文最高提速 169%

Reddit r/LocalLLaMA · 2天前

llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。

0 人收藏 0 人点赞
#quantization

LFM2.5-2.6B 模型+KV缓存量化报告

Reddit r/LocalLLaMA · 2天前

关于使用多种 GGUF 和 KV 缓存量化方式对 LiquidAI 的 LFM2.5-2.6B 模型进行量化的详细报告,显示该模型可适配 8GB 树莓派且性能下降极小,但提醒不要使用 Q4_K_M。

0 人收藏 0 人点赞
#quantization

一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s

Reddit r/LocalLLaMA · 2天前

一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。

0 人收藏 0 人点赞
#quantization

全新 Unsloth KImi K3 发布!Q1_0 (466GB)、TQ1_0 (509GB)、IQ1_M (649)、TQ2_0 (551GB)!!

Reddit r/LocalLLaMA · 3天前

Unsloth 发布了 Kimi K3 的新 GGUF 量化版本,大小从 466GB 到 649GB 不等,使大型模型能够高效部署。

0 人收藏 0 人点赞
#quantization

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

arXiv cs.LG · 3天前 缓存

This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.

0 人收藏 0 人点赞
#quantization

使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%

Reddit r/LocalLLaMA · 3天前

有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。

0 人收藏 0 人点赞
#quantization

最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s

Reddit r/LocalLLaMA · 3天前

详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。

0 人收藏 0 人点赞
#quantization

在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化

arXiv cs.LG · 4天前 缓存

本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。

0 人收藏 0 人点赞
#quantization

递归残差量化:一种面向大语言模型的渐进式多精度表示

arXiv cs.LG · 4天前 缓存

提出了递归残差量化(RRQ),这是一种训练后量化框架,通过加法式残差细化,从单个LLM检查点获得多种有效精度,从而提高了灵活性和构建速度。

0 人收藏 0 人点赞
#quantization

Scenema Audio 登陆 ComfyUI,可在 8GB 显存上运行

Reddit r/LocalLLaMA · 4天前

Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈