quantization

标签

Cards List
#quantization

@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…

X AI KOLs Timeline ↗ · 昨天 缓存

一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。

0 人收藏 0 人点赞
#quantization

Qwen3.8 flash next + ExLlamaV3 + Hermes 真是令人惊叹

Reddit r/LocalLLaMA ↗ · 昨天

用户分享了他们使用 Qwen3.8 模型配合 ExLlamaV3 在 6x3090 GPU 上的积极体验,达到了每秒 80-120 个令牌,并通过 Matrix 控制 Hermes 代理进行日常使用。

0 人收藏 0 人点赞
#quantization

Swift 1.5 27b: Swift Qwen 变得更快

Reddit r/LocalLLaMA ↗ · 昨天 缓存

Swift 1.5 是基于 Qwen3.8-27B 的更新 AI 模型,在智能体和编程任务中提供改进的性能,并支持多种量化以适应不同硬件平台。

0 人收藏 0 人点赞
#quantization

Qwengram-0.8B:我将Qwen3.8 Flash-Next的n-gram记忆转移到了Qwen3.5-0.8B——验证困惑度降低了5.05%

Reddit r/LocalLLaMA ↗ · 2天前

作者将预训练的PLE n-gram记忆从Qwen3.8-Flash-Next转移到Qwen3.5-0.8B,在不微调骨干网络的情况下,验证困惑度降低了5.05%。主要发现包括动态门控和阅读器训练在记忆注入方面的有效性。

0 人收藏 0 人点赞
#quantization

基线形状决定结论:在60K参数下对Ternary语言模型的受控重新检查

arXiv cs.CL ↗ · 2天前 缓存

一项对60K参数下Ternary语言模型的受控重新检查表明,基线形状显著影响性能比较,挑战了关于路由Ternary模型优势的先前说法。

0 人收藏 0 人点赞
#quantization

Qwen Flash Next 在 Q2 量化下是否比 27B 模型在 Q4 量化下更好?

Reddit r/LocalLLaMA ↗ · 2天前

一位用户在 AI 论坛上询问 Qwen Flash Next 在 Q2 量化下是否优于 27B 参数模型在 Q4 量化下的表现。

0 人收藏 0 人点赞
#quantization

Qwen3.8-Flash-Next 在 NVIDIA 5090 和 64GB 内存配置下使用 Llama.cpp - 似乎未使用 RAM?

Reddit r/LocalLLaMA ↗ · 2天前

用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。

0 人收藏 0 人点赞
#quantization

UkisAI Swift系列:27B、Flash Next 和 Bonsai 2 + GSQ-RCO——思考减少63.4%,速度提升1.95倍,高准确度

Reddit r/LocalLLaMA ↗ · 2天前

UkisAI 发布了基于 Qwen 的高效推理大语言模型 Swift 系列,这些模型提供了显著的令牌减少和准确度提升,并支持多种量化选项以供部署。

0 人收藏 0 人点赞
#quantization

@norpadon: 我们已公开发布预览版:https://huggingface.co/trymirai/Qwen3.8-27B-S-experimental… Qwen3.8 27B that fi…

X AI KOLs Timeline ↗ · 3天前 缓存

Qwen3.8-27B-S-experimental 的预览版,一个使用 Mirai S 编解码器的量化 AI 模型,现已在 Hugging Face 上公开可用。它支持在 Apple Silicon 上使用 uzu 和在 NVIDIA 上使用 vLLM 进行推理,并提供性能详情和使用说明。

0 人收藏 0 人点赞
#quantization

教训:不要盲目相信仓库,确保长时间运行(多周)的基准测试稳定可靠。

Reddit r/LocalLLaMA ↗ · 3天前

作者分享了长时间运行的Django基准测试中学到的教训,强调了在评估工作流程稳定性方面的修复,以及更新后的结果,显示Flash Next是表现最佳的模型,现在推理努力级别得到了正确评估。

0 人收藏 0 人点赞
#quantization

量化鲁棒遗忘学习:基于保留-遗忘损失景观交互的视角

arXiv cs.LG ↗ · 3天前 缓存

本文提出一种针对大语言模型的量化鲁棒遗忘学习框架,利用损失景观分析来确保在压缩后有效遗忘的同时维持模型效用。

0 人收藏 0 人点赞
#quantization

@TechMDAI:嘿,各位,快去支持 @ViC305。他对dgx社区至关重要,一直在疯狂产出各种配方…

X AI KOLs Following ↗ · 3天前 缓存

本文鼓励大家支持 @ViC305,他是DGX社区的关键贡献者,从事AI相关工作,如量化和内核开发,尽管他没有DGX Spark。

0 人收藏 0 人点赞
#quantization

@yoheinakajima: glance-vlm speedlab 现已开源!阅读:https://glance.yohei.me/speed/ 尝试:https://github.com/yoheinakajima/glan…

X AI KOLs Timeline ↗ · 3天前 缓存

本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。

0 人收藏 0 人点赞
#quantization

@dzhng: 提供商/实验室经常在发布后根据使用模式和硬件类型调整其量化/推测解码策略……

X AI KOLs Following ↗ · 3天前 缓存

该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。

0 人收藏 0 人点赞
#quantization

DeepSeek-V4-Flash-0731在2× Radeon AI PRO R9700上使用affinity引擎达到约40-50 tok/s(预构建量化+修复)

Reddit r/LocalLLaMA ↗ · 3天前

文章报道了在两块Radeon AI PRO R9700 GPU上使用affinity推理引擎运行DeepSeek-V4-Flash-0731,通过预构建量化和稳定性修复,实现了40-50 tok/s的解码速度。

0 人收藏 0 人点赞
#quantization

可能是 Qwen3.8 27B 最高质量的主线量化版本?

Reddit r/LocalLLaMA ↗ · 3天前

发布了 Qwen 3.8 27B AI 模型的高质量量化版本,声称在质量测试中超越了 ISTA 和 Unsloth 量化版本。

0 人收藏 0 人点赞
#quantization

@Lonely__MH: 全体起立!GGUF量化的Qwen-Image-2.1版本已发布!感谢@UnslothAI团队的加入!基于…

X AI KOLs Timeline ↗ · 4天前 缓存

GGUF量化版的Qwen-Image-2.1 AI模型已发布,采用Dynamic 2.0技术实现高效4位量化,支持文本到图像和透明图像生成,文件大小为4.2GB,适合Mac用户使用。

0 人收藏 0 人点赞
#quantization

transformers 原生支持 GGUF 格式!

Reddit r/LocalLLaMA ↗ · 4天前

Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。

0 人收藏 0 人点赞
#quantization

K2-Horizon 的量化版本现已可用

Reddit r/LocalLLaMA ↗ · 4天前

K2-Horizon AI 模型系列的量化版本现已可在 Hugging Face 上下载,支持从 0.9B 到 36B 参数的多种尺寸。但 llama.cpp 的支持仍在进行中,需要使用分支版本。

0 人收藏 0 人点赞
#quantization

Qwen 3.8 27B 在 RTX 3060 上使用约 3 BPW:GSQ 与 ByteShape IQ3-XXS 2.88BPW 的比较

Reddit r/LocalLLaMA ↗ · 4天前

本文比较了在 RTX 3060 上对 Qwen 3.8 27B 模型进行 GSQ 和 ByteShape 量化的结果,揭示了尽管 ByteShape 量化声称与原始模型高度相似,但其性能却表现不佳。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈