quantization

标签

Cards List
#quantization

[发布] 适用于 Qwen3.8-Flash-Next 的 GSQ-RCO GGUF 量化文件,以及一个50%专家剪枝的 Coder 版本,平均比特率约1.89 bpw

Reddit r/LocalLLaMA ↗ · 11小时前

发布了 Qwen3.8-Flash-Next 的 GSQ-RCO 量化和专家剪枝版本,在降低比特率的同时达到 BF16 级别的性能,并支持在更小硬件上部署。

0 人收藏 0 人点赞
#quantization

余弦相似度并非证据:量化下可解释性转移的噪声基线测量

arXiv cs.LG ↗ · 16小时前 缓存

本文指出,仅凭余弦相似度不足以作为AI模型中量化下可解释性转移的证据,并提出一种测量噪声基线的方法,同时展示高相似度值可能并不意味着真正的保留。

0 人收藏 0 人点赞
#quantization

ESP32S3集群运行1.58位(BitNet)语言模型

Hacker News Top ↗ · 23小时前 缓存

本项目实现了一个分布式流水线推理引擎,在一个由七个ESP32S3微控制器组成的集群上运行一个0.5B BitNet语言模型,采用1.58位量化和SPI菊花链通信。

0 人收藏 0 人点赞
#quantization

单张3090上为Qwen3.8 27B实现95+ TPS,支持100K生成与262K上下文

Reddit r/LocalLLaMA ↗ · 昨天

LlamAmpere v0.4发布,包含Ampere特定优化,在单张NVIDIA 3090 GPU上为Qwen3.8-27B模型实现超过95 TPS的速度,并支持262K上下文。

0 人收藏 0 人点赞
#quantization

I-Parakeet: 专为移动NPU优化的纯整数Conformer ASR模型

arXiv cs.CL ↗ · 昨天 缓存

本文介绍了I-Parakeet,一个专为移动NPU优化的纯整数Conformer ASR模型,实现了高效的设备端语音识别。

0 人收藏 0 人点赞
#quantization

LuffyTheFox/Swift-Qwen3.8-27B-Genesis-GGUF

Reddit r/LocalLLaMA ↗ · 昨天

用户探索了Swift-Qwen3.8-7B模型的量化变体,采用GGUF格式,指出其紧凑的尺寸允许在32GB显存中使用完整的262k上下文,并报告了基准性能。

0 人收藏 0 人点赞
#quantization

双Tesla p100, q6_k量化, Qwen 3.8 27B 约60 tps V3.0

Reddit r/LocalLLaMA ↗ · 昨天

一位用户分享了针对Tesla P100 GPU的内核优化,以提升使用llama.cpp运行Qwen 3.8模型时的性能,实现了显著的推理加速。

0 人收藏 0 人点赞
#quantization

……所以,是的。

Reddit r/LocalLLaMA ↗ · 2天前

用户分享了在Mac M4Pro上运行Qwen3.8-Flash-Next模型的经验,强调通过量化获得更快的性能,并使用llama.cpp实现了131K的上下文大小。

0 人收藏 0 人点赞
#quantization

为Qwen模型添加对‘wait’、‘maybe’和‘perhaps’的对数惩罚可提升其准确性

Reddit r/LocalLLaMA ↗ · 2天前

一项实验使用llama.cpp对Qwen模型中的特定过度思考令牌应用对数惩罚,从而在各种量化下提高了MATH-500基准的准确性,带来了显著的准确性提升和推理令牌的减少。

0 人收藏 0 人点赞
#quantization

@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…

X AI KOLs Timeline ↗ · 3天前 缓存

一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。

0 人收藏 0 人点赞
#quantization

Qwen3.8 flash next + ExLlamaV3 + Hermes 真是令人惊叹

Reddit r/LocalLLaMA ↗ · 3天前

用户分享了他们使用 Qwen3.8 模型配合 ExLlamaV3 在 6x3090 GPU 上的积极体验,达到了每秒 80-120 个令牌,并通过 Matrix 控制 Hermes 代理进行日常使用。

0 人收藏 0 人点赞
#quantization

Swift 1.5 27b: Swift Qwen 变得更快

Reddit r/LocalLLaMA ↗ · 3天前 缓存

Swift 1.5 是基于 Qwen3.8-27B 的更新 AI 模型,在智能体和编程任务中提供改进的性能,并支持多种量化以适应不同硬件平台。

0 人收藏 0 人点赞
#quantization

Qwengram-0.8B:我将Qwen3.8 Flash-Next的n-gram记忆转移到了Qwen3.5-0.8B——验证困惑度降低了5.05%

Reddit r/LocalLLaMA ↗ · 4天前

作者将预训练的PLE n-gram记忆从Qwen3.8-Flash-Next转移到Qwen3.5-0.8B,在不微调骨干网络的情况下,验证困惑度降低了5.05%。主要发现包括动态门控和阅读器训练在记忆注入方面的有效性。

0 人收藏 0 人点赞
#quantization

基线形状决定结论:在60K参数下对Ternary语言模型的受控重新检查

arXiv cs.CL ↗ · 4天前 缓存

一项对60K参数下Ternary语言模型的受控重新检查表明,基线形状显著影响性能比较,挑战了关于路由Ternary模型优势的先前说法。

0 人收藏 0 人点赞
#quantization

G^2PTQ:通过广义梯度补偿改进大语言模型训练后量化

Hugging Face Daily Papers ↗ · 4天前 缓存

本文提出G^2PTQ,一种统一的大语言模型训练后量化框架,采用广义梯度补偿来改善与全精度模型的对齐,优于最先进基线。

0 人收藏 0 人点赞
#quantization

Softmax重参数化用于输出头量化

Hugging Face Daily Papers ↗ · 4天前 缓存

本文提出了一种softmax重参数化方法,这是一种后训练方法,在量化前选择一个功能等效的输出头,以降低小型语言模型的推理成本。该方法在各种量化技术和数据集上都展示了显著的改进。

0 人收藏 0 人点赞
#quantization

Qwen Flash Next 在 Q2 量化下是否比 27B 模型在 Q4 量化下更好?

Reddit r/LocalLLaMA ↗ · 4天前

一位用户在 AI 论坛上询问 Qwen Flash Next 在 Q2 量化下是否优于 27B 参数模型在 Q4 量化下的表现。

0 人收藏 0 人点赞
#quantization

Qwen3.8-Flash-Next 在 NVIDIA 5090 和 64GB 内存配置下使用 Llama.cpp - 似乎未使用 RAM?

Reddit r/LocalLLaMA ↗ · 4天前

用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。

0 人收藏 0 人点赞
#quantization

UkisAI Swift系列:27B、Flash Next 和 Bonsai 2 + GSQ-RCO——思考减少63.4%,速度提升1.95倍,高准确度

Reddit r/LocalLLaMA ↗ · 5天前

UkisAI 发布了基于 Qwen 的高效推理大语言模型 Swift 系列,这些模型提供了显著的令牌减少和准确度提升,并支持多种量化选项以供部署。

0 人收藏 0 人点赞
#quantization

@norpadon: 我们已公开发布预览版:https://huggingface.co/trymirai/Qwen3.8-27B-S-experimental… Qwen3.8 27B that fi…

X AI KOLs Timeline ↗ · 5天前 缓存

Qwen3.8-27B-S-experimental 的预览版,一个使用 Mirai S 编解码器的量化 AI 模型,现已在 Hugging Face 上公开可用。它支持在 Apple Silicon 上使用 uzu 和在 NVIDIA 上使用 vLLM 进行推理,并提供性能详情和使用说明。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈