quantization

标签

Cards List
#quantization

Kimi K3 (Unsloth) IQ2-XXS 从 711GB 降至 478GB!!! 仅移除多语言来缩减体积

Reddit r/LocalLLaMA · 4小时前

Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。

0 人收藏 0 人点赞
#quantization

目前理论上的 LLM 量化最佳位宽是什么?[D]

Reddit r/MachineLearning · 昨天

一个讨论性问题,询问在固定内存预算下 LLM 量化的理论最佳位宽,并引用了 2025-2026 年关于 3-bit/2-bit 结果和缩放定律的研究。

0 人收藏 0 人点赞
#quantization

llama.cpp PR 报告:仅切换一个 SYCL 内核,Intel Battlemage 上量化 KV 解码在 118K 上下文最高提速 169%

Reddit r/LocalLLaMA · 昨天

llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。

0 人收藏 0 人点赞
#quantization

LFM2.5-2.6B 模型+KV缓存量化报告

Reddit r/LocalLLaMA · 昨天

关于使用多种 GGUF 和 KV 缓存量化方式对 LiquidAI 的 LFM2.5-2.6B 模型进行量化的详细报告,显示该模型可适配 8GB 树莓派且性能下降极小,但提醒不要使用 Q4_K_M。

0 人收藏 0 人点赞
#quantization

一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s

Reddit r/LocalLLaMA · 昨天

一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。

0 人收藏 0 人点赞
#quantization

全新 Unsloth KImi K3 发布!Q1_0 (466GB)、TQ1_0 (509GB)、IQ1_M (649)、TQ2_0 (551GB)!!

Reddit r/LocalLLaMA · 昨天

Unsloth 发布了 Kimi K3 的新 GGUF 量化版本,大小从 466GB 到 649GB 不等,使大型模型能够高效部署。

0 人收藏 0 人点赞
#quantization

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

arXiv cs.LG · 2天前 缓存

This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.

0 人收藏 0 人点赞
#quantization

使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%

Reddit r/LocalLLaMA · 2天前

有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。

0 人收藏 0 人点赞
#quantization

最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s

Reddit r/LocalLLaMA · 2天前

详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。

0 人收藏 0 人点赞
#quantization

在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化

arXiv cs.LG · 3天前 缓存

本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。

0 人收藏 0 人点赞
#quantization

递归残差量化:一种面向大语言模型的渐进式多精度表示

arXiv cs.LG · 3天前 缓存

提出了递归残差量化(RRQ),这是一种训练后量化框架,通过加法式残差细化,从单个LLM检查点获得多种有效精度,从而提高了灵活性和构建速度。

0 人收藏 0 人点赞
#quantization

Scenema Audio 登陆 ComfyUI,可在 8GB 显存上运行

Reddit r/LocalLLaMA · 3天前

Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。

0 人收藏 0 人点赞
#quantization

Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。

Reddit r/LocalLLaMA · 3天前

Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。

0 人收藏 0 人点赞
#quantization

jabbatheduck/DeepSeek-v4-flash-mini · Hugging Face

Reddit r/LocalLLaMA · 3天前 缓存

jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。

0 人收藏 0 人点赞
#quantization

Kijai/MiniMax-H3-experimental

Hugging Face Models Trending · 3天前 缓存

Kijai 的 MiniMax-H3-experimental 是一个尚在开发中的模型,支持 w4a8 量化和用于 ComfyUI 的 int8_convrot VAE,仅为测试目的而发布。

0 人收藏 0 人点赞
#quantization

@seclink: 有几个显而易见的面试题是: 1. Transformer 能不能做大模型推理? 能做,那为啥不用,而是必须用 sglang 、 vllm ? - 其实本质上还是因为 Transformer 性能太拉垮 ,瓶颈在显存 (KV cache )…

X AI KOLs Timeline · 4天前 缓存

讨论Transformer做大规模推理的瓶颈,并梳理2023到2026年间大模型推理优化技术的演进,包括KV cache量化、推测解码、架构创新和软硬件协同设计。

0 人收藏 0 人点赞
#quantization

NANQ:面向模拟存内计算的噪声底感知混合精度非均匀量化

arXiv cs.LG · 4天前 缓存

本文提出了NANQ,一种面向模拟存内计算(CIM)系统的噪声底感知混合精度非均匀量化框架,它根据硬件噪声特性调整量化精度,并在低位宽约束下提高模型精度。

0 人收藏 0 人点赞
#quantization

输出感知的INT2 KV缓存量化旋转方法

arXiv cs.LG · 4天前 缓存

提出了OptR,一种用于INT2 KV缓存量化的输出感知旋转方法,可最小化输出后的注意力误差,在多个模型和基准上改进QuaRot和OSCAR。

0 人收藏 0 人点赞
#quantization

ARCHead: 面向大语言模型输出头的激活度量残差校正

arXiv cs.CL · 4天前 缓存

ARCHead 是一种紧凑的 LM-head 压缩器,结合了量化低秩因子、INT4 残差和激活度量校正,在保持困惑度的同时将存储减少约 3.7–3.9 倍,作为现有块量化器的补充。

0 人收藏 0 人点赞
#quantization

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA · 4天前

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈