quantization

标签

Cards List
#quantization

transformers 原生支持 GGUF 格式!

Reddit r/LocalLLaMA ↗ · 4天前

Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。

0 人收藏 0 人点赞
#quantization

K2-Horizon 的量化版本现已可用

Reddit r/LocalLLaMA ↗ · 5天前

K2-Horizon AI 模型系列的量化版本现已可在 Hugging Face 上下载,支持从 0.9B 到 36B 参数的多种尺寸。但 llama.cpp 的支持仍在进行中,需要使用分支版本。

0 人收藏 0 人点赞
#quantization

Qwen 3.8 27B 在 RTX 3060 上使用约 3 BPW:GSQ 与 ByteShape IQ3-XXS 2.88BPW 的比较

Reddit r/LocalLLaMA ↗ · 5天前

本文比较了在 RTX 3060 上对 Qwen 3.8 27B 模型进行 GSQ 和 ByteShape 量化的结果,揭示了尽管 ByteShape 量化声称与原始模型高度相似,但其性能却表现不佳。

0 人收藏 0 人点赞
#quantization

UnslothAI:Qwen-Image-2.1 现在可以使用 Unsloth GGUFs 在12GB VRAM 上本地运行!7B 模型性能与 Nano Banana 2.0 相当。 …

X AI KOLs Timeline ↗ · 5天前 缓存

Unsloth 发布了 Qwen-Image-2.1 的 GGUF 量化版本,使其能够在12GB VRAM 上本地运行,性能与 Nano Banana 2.0 相当。

0 人收藏 0 人点赞
#quantization

Claude 对比 Antigravity 对比 3.827b 对比 Flash Next 对比 Bonsai 对比 Swift... 我基于自己的Git提交历史构建了自定义质量基准测试框架,初步结果令人惊讶且震惊。

Reddit r/LocalLLaMA ↗ · 5天前

作者利用自己的git历史记录构建了一个自定义基准测试框架,用于评估本地AI模型在代码任务中的表现。早期测试结果显示,Flash Next和Swift等模型的性能表现令人惊讶。

0 人收藏 0 人点赞
#quantization

量化对临床基准的影响:跨模型家族的准确性与安全性

arXiv cs.LG ↗ · 5天前 缓存

本研究评估了量化如何影响大型语言模型在临床基准上的准确性和安全性,发现INT8量化普遍安全,而INT4量化则带来模型和任务相关的风险。

0 人收藏 0 人点赞
#quantization

PRQuant: 置换残差量化用于低开销推理

arXiv cs.LG ↗ · 5天前 缓存

PRQuant 是一种无需训练且低开销的框架,用于量化大型语言模型中的线性层,通过置换和残差补偿来减少推理延迟,同时在如MXFP4等基准上提升准确性。

0 人收藏 0 人点赞
#quantization

小GPU与小RAM用户的优秀编码器!

Reddit r/LocalLLaMA ↗ · 6天前

新量化AI模型Sharp-Spark-X2.5-4B-GGUF发布,针对小GPU和有限内存优化代理编码能力,提升资源有限用户的本地编码体验。

0 人收藏 0 人点赞
#quantization

【Splash Engine】Qwen3.8-27B在Apple Silicon上原生8位运行,速度达37-55 tok/s:扩展Splash至Q8、256k上下文缩放及"推理悬崖"

Reddit r/LocalLLaMA ↗ · 6天前

扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。

0 人收藏 0 人点赞
#quantization

@shao__meng: https://x.com/shao__meng/status/2101835798316495007

X AI KOLs Timeline ↗ · 6天前 缓存

Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。

0 人收藏 0 人点赞
#quantization

abenzerps/Qwen-Image-2.1-无审查-GGUF

Hugging Face Models Trending ↗ · 2026-09-20 缓存

Qwen-Image-2.1模型的GGUF量化版本,用于使用ComfyUI进行本地图像生成,包含推荐的量化方式和部署设置说明。

0 人收藏 0 人点赞
#quantization

我在有限显存(16-20GB)上对 Qwen 3.8 27B 的测试

Reddit r/LocalLLaMA ↗ · 2026-09-20

本文测试了在有限显存环境下各种量化版本的 Qwen 3.8 27B AI 模型,比较了它们在动画生成、应用开发和单词生成等任务上的表现。

0 人收藏 0 人点赞
#quantization

致所有使用3x 3090进行本地LLM的朋友——我找到了目前最佳方案

Reddit r/LocalLLaMA ↗ · 2026-09-20

作者发现,在3张3090显卡上使用Exllama3以3.05 bpw运行Qwen 3.8 Next Flash,能为本地LLM使用提供卓越的性能和质量,优于其他量化方法。

0 人收藏 0 人点赞
#quantization

拜托了,别再用FP4推理引擎了

Reddit r/LocalLLaMA ↗ · 2026-09-20

作者批评在推理引擎中使用FP4量化的趋势,认为它严重降低模型质量并导致幻觉,尤其是对于小型密集模型。

0 人收藏 0 人点赞
#quantization

真诚提问:更小的量化模型是否正在成为本地AI的最佳选择?

Reddit r/LocalLLaMA ↗ · 2026-09-19

文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。

0 人收藏 0 人点赞
#quantization

我对比测试了 Qwen3.8 27B IQ3_XXS (10.18GiB) 和 Bonsai Ternary PQ2 (6.42GiB)

Reddit r/LocalLLaMA ↗ · 2026-09-19

作者在有限的显存下比较了 Qwen3.8 27B IQ3_XXS 和 Bonsai Ternary PQ2 的性能,发现 Qwen 更快且使用的 token 更少,而 Bonsai 文件更小但生成时间更长。

0 人收藏 0 人点赞
#quantization

Qwen3.8-Flash-Next (95.5 GiB) 在 64GB Mac 上以约 27 tok/s 运行,检查点与叉版本

Reddit r/LocalLLaMA ↗ · 2026-09-18

作者优化了 Qwen3.8-Flash-Next 模型,使其能在 64GB Mac 上运行,使用专家流式处理和其他技术,通过发布检查点和 llama.cpp 叉版本达到约 27 tok/s 的速度。

0 人收藏 0 人点赞
#quantization

RTX 5090 上的 Bonsai 2 27B、Gemma 4 12B 和 Qwen 3.5 9B:日式体素宝塔生成对比

Reddit r/LocalLLaMA ↗ · 2026-09-18

本文对比了 Bonsai 2 27B、Gemma 4 12B 和 Qwen 3.5 9B 模型在使用 RTX 5090 生成日式体素宝塔时的性能,结论是 Bonsai 在内存占用方面提供了更优的智能和细节,对本地 AI 社区有益。

0 人收藏 0 人点赞
#quantization

Prism-ML Bonsai 2 加入我们的 Qwen3.8 量化比较

Reddit r/LocalLLaMA ↗ · 2026-09-18

Prism-LM 的基于 Qwen3.8 的 Bonsai 2 QAT 模型已被评估并加入比较研究,在综合基准测试中达到约 91.5%,并为模型权衡提供了可靠的参考。

0 人收藏 0 人点赞
#quantization

问题: UkisAI Swift Ternary Bonsai 2 27B?

Reddit r/LocalLLaMA ↗ · 2026-09-18

Jovan 来自 UkisAI,讨论了他们 Swift Qwen3.8 27B 模型的改进,并寻求社区反馈以创建 Bonsai 2 的 Swift 版本,以解决过度思考循环和高令牌使用问题。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈