4-bit

标签

Cards List
#4-bit

@superalesha: 别急着埋葬RTX 3090,先读完这个!@UnslothAI本周发布了qwen3.6-35b的两个新4位量化版本。我花了…

X AI KOLs Timeline · 2026-07-11 缓存

对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。

0 人收藏 0 人点赞
#4-bit

在4台DGX Spark上运行4-bit量化GLM-5.2(753B MoE):Terminal-Bench 2.1得分70.8%,完整模型为81.0%

Reddit r/LocalLLaMA · 2026-07-08

在4台DGX Spark机器上运行4-bit量化版GLM-5.2(753B MoE),Terminal-Bench 2.1得分为70.8%,而完整模型为81.0%。

0 人收藏 0 人点赞
#4-bit

FourTune:迈向扩散模型全4比特高效后训练

arXiv cs.LG · 2026-07-08 缓存

FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。

0 人收藏 0 人点赞
#4-bit

@no_stp_on_snek: 相当不错。我自己跑了一些测试。在我看来这是个挺不错的模型。

X AI KOLs Following · 2026-07-02 缓存

NVIDIA 的 4 位量化 Qwen3.6-27B 模型(NVFP4)据称接近无损,在四分之一大小下保持了全尺寸质量。

0 人收藏 0 人点赞
#4-bit

@no_stp_on_snek:好了朋友们,你们懂的.. 结论前置:NVIDIA 的 4 位 Qwen3.6-27B (NVFP4) 近乎无损。在我自己的保留测试中…

X AI KOLs Following · 2026-07-02 缓存

NVIDIA 的 4 位量化版 Qwen3.6-27B (NVFP4) 相较于完整的 bf16 模型被发现近乎无损,行为差异微小且随机而非系统性,使其成为实用的即插即用替代品。

0 人收藏 0 人点赞
#4-bit

Deepseek V4 Flash 2位、3位和4位 GGUFs

Reddit r/LocalLLaMA · 2026-07-01 缓存

DeepSeek V4 Flash 的 2位、3位和4位精度 GGUF 量化版本,已在 Hugging Face 上发布,可用于 llama.cpp 和 Ollama 等工具的本地推理。

0 人收藏 0 人点赞
#4-bit

TD4 4位DIY CPU指南

Hacker News Top · 2026-06-18 缓存

关于构建和理解来自阿里巴巴的TD4 4位DIY CPU套件的详细指南,涵盖焊接、原理图和操作原理。

0 人收藏 0 人点赞
#4-bit

Alpie Core 32B, 4位:任何真实智能体工作流测试或仅供应商基准测试?

Reddit r/AI_Agents · 2026-06-11

文章质疑了Alpie Core 32B(一个针对低显存和智能体工作流优化的4位推理编码模型)的供应商基准测试的有效性,指出缺乏独立的基准测试复现。

0 人收藏 0 人点赞
#4-bit

@UnslothAI:4-bit Qwen3.6 MTP GGUF 成功从单个提示中搜索70多个网站。通过 Unsloth Studio 在20GB内存上本地尝试…

X AI KOLs Timeline · 2026-05-19 缓存

UnslothAI 宣布,其 4-bit Qwen3.6 MTP GGUF 模型仅凭单个提示即可搜索超过70个网站,通过 Unsloth Studio 可在20GB内存上本地运行。此次更新增加了自动 MTP 和推测解码支持。

0 人收藏 0 人点赞
#4-bit

介绍 cyankiwi AWQ 4-bit 量化——26.05 更新

Reddit r/LocalLLaMA · 2026-05-14

Cyankiwi 推出了其 AWQ 4-bit 量化方法的更新版本,该方法联合优化缩放因子和量化范围,在 Llama-3 模型上实现了比现有方法更低的 KL 散度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈