quantization

标签

Cards List
#quantization

量化鲁棒遗忘学习:基于保留-遗忘损失景观交互的视角

arXiv cs.LG ↗ · 5天前 缓存

本文提出一种针对大语言模型的量化鲁棒遗忘学习框架,利用损失景观分析来确保在压缩后有效遗忘的同时维持模型效用。

0 人收藏 0 人点赞
#quantization

orcarouter/OrcaSAQ-2-27B

Hugging Face Models Trending ↗ · 5天前 缓存

OrcaSAQ2 27B 是 Qwen3.8-27B 的高保真3位量化版本,将大小从54 GB减少到12.3 GB,困惑度增加极小且一致性高,针对长期代理和推理任务进行了优化。

0 人收藏 0 人点赞
#quantization

@TechMDAI:嘿,各位,快去支持 @ViC305。他对dgx社区至关重要,一直在疯狂产出各种配方…

X AI KOLs Following ↗ · 5天前 缓存

本文鼓励大家支持 @ViC305,他是DGX社区的关键贡献者,从事AI相关工作,如量化和内核开发,尽管他没有DGX Spark。

0 人收藏 0 人点赞
#quantization

@yoheinakajima: glance-vlm speedlab 现已开源!阅读:https://glance.yohei.me/speed/ 尝试:https://github.com/yoheinakajima/glan…

X AI KOLs Timeline ↗ · 5天前 缓存

本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。

0 人收藏 0 人点赞
#quantization

@dzhng: 提供商/实验室经常在发布后根据使用模式和硬件类型调整其量化/推测解码策略……

X AI KOLs Following ↗ · 5天前 缓存

该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。

0 人收藏 0 人点赞
#quantization

DeepSeek-V4-Flash-0731在2× Radeon AI PRO R9700上使用affinity引擎达到约40-50 tok/s(预构建量化+修复)

Reddit r/LocalLLaMA ↗ · 5天前

文章报道了在两块Radeon AI PRO R9700 GPU上使用affinity推理引擎运行DeepSeek-V4-Flash-0731,通过预构建量化和稳定性修复,实现了40-50 tok/s的解码速度。

0 人收藏 0 人点赞
#quantization

可能是 Qwen3.8 27B 最高质量的主线量化版本?

Reddit r/LocalLLaMA ↗ · 5天前

发布了 Qwen 3.8 27B AI 模型的高质量量化版本,声称在质量测试中超越了 ISTA 和 Unsloth 量化版本。

0 人收藏 0 人点赞
#quantization

@Lonely__MH: 全体起立!GGUF量化的Qwen-Image-2.1版本已发布!感谢@UnslothAI团队的加入!基于…

X AI KOLs Timeline ↗ · 6天前 缓存

GGUF量化版的Qwen-Image-2.1 AI模型已发布,采用Dynamic 2.0技术实现高效4位量化,支持文本到图像和透明图像生成,文件大小为4.2GB,适合Mac用户使用。

0 人收藏 0 人点赞
#quantization

transformers 原生支持 GGUF 格式!

Reddit r/LocalLLaMA ↗ · 6天前

Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。

0 人收藏 0 人点赞
#quantization

K2-Horizon 的量化版本现已可用

Reddit r/LocalLLaMA ↗ · 6天前

K2-Horizon AI 模型系列的量化版本现已可在 Hugging Face 上下载,支持从 0.9B 到 36B 参数的多种尺寸。但 llama.cpp 的支持仍在进行中,需要使用分支版本。

0 人收藏 0 人点赞
#quantization

Qwen 3.8 27B 在 RTX 3060 上使用约 3 BPW:GSQ 与 ByteShape IQ3-XXS 2.88BPW 的比较

Reddit r/LocalLLaMA ↗ · 6天前

本文比较了在 RTX 3060 上对 Qwen 3.8 27B 模型进行 GSQ 和 ByteShape 量化的结果,揭示了尽管 ByteShape 量化声称与原始模型高度相似,但其性能却表现不佳。

0 人收藏 0 人点赞
#quantization

UnslothAI:Qwen-Image-2.1 现在可以使用 Unsloth GGUFs 在12GB VRAM 上本地运行!7B 模型性能与 Nano Banana 2.0 相当。 …

X AI KOLs Timeline ↗ · 6天前 缓存

Unsloth 发布了 Qwen-Image-2.1 的 GGUF 量化版本,使其能够在12GB VRAM 上本地运行,性能与 Nano Banana 2.0 相当。

0 人收藏 0 人点赞
#quantization

Claude 对比 Antigravity 对比 3.827b 对比 Flash Next 对比 Bonsai 对比 Swift... 我基于自己的Git提交历史构建了自定义质量基准测试框架,初步结果令人惊讶且震惊。

Reddit r/LocalLLaMA ↗ · 2026-09-22

作者利用自己的git历史记录构建了一个自定义基准测试框架,用于评估本地AI模型在代码任务中的表现。早期测试结果显示,Flash Next和Swift等模型的性能表现令人惊讶。

0 人收藏 0 人点赞
#quantization

量化对临床基准的影响:跨模型家族的准确性与安全性

arXiv cs.LG ↗ · 2026-09-22 缓存

本研究评估了量化如何影响大型语言模型在临床基准上的准确性和安全性,发现INT8量化普遍安全,而INT4量化则带来模型和任务相关的风险。

0 人收藏 0 人点赞
#quantization

PRQuant: 置换残差量化用于低开销推理

arXiv cs.LG ↗ · 2026-09-22 缓存

PRQuant 是一种无需训练且低开销的框架,用于量化大型语言模型中的线性层,通过置换和残差补偿来减少推理延迟,同时在如MXFP4等基准上提升准确性。

0 人收藏 0 人点赞
#quantization

解耦量化:专用于大语言模型预填充与解码阶段

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

本文介绍了解耦量化,一种针对大语言模型预填充和解码阶段定制量化方法以提升推理效率和准确性的技术。

0 人收藏 0 人点赞
#quantization

小GPU与小RAM用户的优秀编码器!

Reddit r/LocalLLaMA ↗ · 2026-09-21

新量化AI模型Sharp-Spark-X2.5-4B-GGUF发布,针对小GPU和有限内存优化代理编码能力,提升资源有限用户的本地编码体验。

0 人收藏 0 人点赞
#quantization

【Splash Engine】Qwen3.8-27B在Apple Silicon上原生8位运行,速度达37-55 tok/s:扩展Splash至Q8、256k上下文缩放及"推理悬崖"

Reddit r/LocalLLaMA ↗ · 2026-09-21

扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。

0 人收藏 0 人点赞
#quantization

@shao__meng: https://x.com/shao__meng/status/2101835798316495007

X AI KOLs Timeline ↗ · 2026-09-21 缓存

Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。

0 人收藏 0 人点赞
#quantization

abenzerps/Qwen-Image-2.1-无审查-GGUF

Hugging Face Models Trending ↗ · 2026-09-20 缓存

Qwen-Image-2.1模型的GGUF量化版本,用于使用ComfyUI进行本地图像生成,包含推荐的量化方式和部署设置说明。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈