quantization

标签

Cards List
#quantization

ARCHead: 面向大语言模型输出头的激活度量残差校正

arXiv cs.CL · 4天前 缓存

ARCHead 是一种紧凑的 LM-head 压缩器,结合了量化低秩因子、INT4 残差和激活度量校正,在保持困惑度的同时将存储减少约 3.7–3.9 倍,作为现有块量化器的补充。

0 人收藏 0 人点赞
#quantization

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA · 4天前

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

0 人收藏 0 人点赞
#quantization

DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试

Reddit r/LocalLLaMA · 5天前

用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。

0 人收藏 0 人点赞
#quantization

在 500MB 内存上运行 Gemma 4

Reddit r/LocalLLaMA · 5天前

讨论了如何在仅有 500MB 内存的设备上运行 Gemma 4,可能通过量化或其他优化技术实现。

0 人收藏 0 人点赞
#quantization

Deepseek V4 Flash 2-bit 量化是我能在本地运行且在此 SQL 基准测试中达到 100% 的首个模型

Reddit r/LocalLLaMA · 5天前

一位用户报告称,DeepSeek V4 Flash 以 2-bit 量化 GGUF 形式在双 RTX 3080 上运行,是首个在真实世界 SQL 基准测试中取得 100% 得分的本地模型,与 Opus 4.7 和 GPT-5.5 等前沿模型持平。

0 人收藏 0 人点赞
#quantization

带更新模板的 DeepSeek V4 Flash 0731 GGUF(支持推理级别)

Reddit r/LocalLLaMA · 5天前 缓存

DeepSeek-V4-Flash-0731-GGUF 的 Hugging Face 页面,这是 DeepSeek V4 Flash 的 GGUF 量化版本,带有支持推理级别的更新模板,可直接用于 llama.cpp、vLLM、Ollama 及其他本地推理工具。

0 人收藏 0 人点赞
#quantization

DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps

Reddit r/LocalLLaMA · 5天前

一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。

0 人收藏 0 人点赞
#quantization

千字节模型:神经网络作为种子与量化潜向量

arXiv cs.LG · 5天前 缓存

本文介绍了“千字节模型”,一种极端压缩范式,其中神经网络权重从种子和量化潜向量重新生成,利用映射网络和分块种子基将存储减少到千字节级别。

0 人收藏 0 人点赞
#quantization

SparseKAN: Compressing Kolmogorov--Arnold Networks Across Basis Functions, Neurons, and Bits

arXiv cs.LG · 5天前 缓存

SparseKAN is a unified compression method for Kolmogorov–Arnold Networks that prunes basis functions, neurons, and numerical precision under learnable gates, achieving up to 73% parameter reduction and significant latency improvements on software and FPGA hardware.

0 人收藏 0 人点赞
#quantization

Kolmogorov--Arnold网络在硬约束循环物理信息模型中的嵌入式RISC-V评估

arXiv cs.LG · 5天前 缓存

本文在嵌入式RISC-V平台上评估了Kolmogorov–Arnold网络(KAN)与MLP作为硬约束循环物理信息网络中残差分支的性能,发现KAN运行更慢、能耗更高,且在INT8量化下可靠性较低。

0 人收藏 0 人点赞
#quantization

@rohanpaul_ai:atomic[.]chat 刚刚发布了 DeepSeek V4 Flash 0731 的 14 个压缩量化构建版本。从无损 BF16 到 1 位,GGUF……

X AI KOLs Timeline · 5天前 缓存

atomic.chat 发布了 DeepSeek V4 Flash 0731 的 14 个量化 GGUF 构建版本,从无损 BF16 到 1 位。他们推荐在 128GB 硬件上使用 AD-IQ2_M,该版本在 83.6% 的情况下与原始模型的 token 选择一致。

0 人收藏 0 人点赞
#quantization

sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Hugging Face Models Trending · 5天前 缓存

发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。

0 人收藏 0 人点赞
#quantization

@aisearchio: Minimax H3 GGUFs 来了!Q2 仅有 8.49 GB,因此你可以在较低端的 GPU 上运行它。 https://huggingface.co/realrebela…

X AI KOLs Timeline · 6天前 缓存

宣布 MiniMax H3 的 GGUF 量化版本现已可用,其中 Q2 版本仅有 8.49 GB,适合较低端的 GPU。

0 人收藏 0 人点赞
#quantization

更小、更快、更安全:大规模运行Kimi和GLM

Hacker News Top · 6天前 缓存

Cloudflare详细介绍了如何利用FP8 KV缓存量化和权重压缩,高效服务Kimi K2.6和GLM 5.2等大型开源MoE模型,在不损失准确性的情况下提升吞吐量并降低成本。

0 人收藏 0 人点赞
#quantization

Explanation of INT8 ConvRot (FP8 is no longer needed)

Hacker News Top · 6天前 缓存

ComfyUI v0.27.0でネイティブ対応されたINT8 ConvRot量子化手法について、FP8を超える性能報告やモデル格納形式の分類を含む技術解説記事。

0 人收藏 0 人点赞
#quantization

我简直不敢相信,我居然在家用PC上运行了前沿模型DeepSeek-V4-Flash-0731。太疯狂了!

Reddit r/LocalLLaMA · 6天前

一位用户对在配备24GB显存的中端Windows PC上通过量化运行前沿模型DeepSeek-V4-Flash-0731表示震惊,凸显了本地AI的飞速进步。

0 人收藏 0 人点赞
#quantization

量化对知识的损害是非线性的 - Qwen3.6 27B 案例研究

Reddit r/LocalLLaMA · 6天前 缓存

关于量化如何影响 Qwen3.6 27B 中事实知识的案例研究,表明知识损失呈非线性扩展,且与基准分数不同,在低比特宽度下,冷门事实的退化最为严重。

0 人收藏 0 人点赞
#quantization

V4-Flash-0731 - 首个周末使用后的感受

Reddit r/LocalLLaMA · 6天前

一位用户在周末测试后分享了V4-Flash-0731的实际使用感受,指出量化会严重降低性能,Q3权重可以在代理工作流中替代Qwen3.6-27B,全精度版本以极低的成本接近GLM 5.2级别,但在通用知识方面较弱。

0 人收藏 0 人点赞
#quantization

MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频

Hacker News Top · 6天前 缓存

MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。

0 人收藏 0 人点赞
#quantization

@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……

X AI KOLs Following · 6天前 缓存

DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈