标签
本文介绍了I-Parakeet,一个专为移动NPU优化的纯整数Conformer ASR模型,实现了高效的设备端语音识别。
用户探索了Swift-Qwen3.8-7B模型的量化变体,采用GGUF格式,指出其紧凑的尺寸允许在32GB显存中使用完整的262k上下文,并报告了基准性能。
一位用户分享了针对Tesla P100 GPU的内核优化,以提升使用llama.cpp运行Qwen 3.8模型时的性能,实现了显著的推理加速。
用户分享了在Mac M4Pro上运行Qwen3.8-Flash-Next模型的经验,强调通过量化获得更快的性能,并使用llama.cpp实现了131K的上下文大小。
一项实验使用llama.cpp对Qwen模型中的特定过度思考令牌应用对数惩罚,从而在各种量化下提高了MATH-500基准的准确性,带来了显著的准确性提升和推理令牌的减少。
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。
用户分享了他们使用 Qwen3.8 模型配合 ExLlamaV3 在 6x3090 GPU 上的积极体验,达到了每秒 80-120 个令牌,并通过 Matrix 控制 Hermes 代理进行日常使用。
Swift 1.5 是基于 Qwen3.8-27B 的更新 AI 模型,在智能体和编程任务中提供改进的性能,并支持多种量化以适应不同硬件平台。
作者将预训练的PLE n-gram记忆从Qwen3.8-Flash-Next转移到Qwen3.5-0.8B,在不微调骨干网络的情况下,验证困惑度降低了5.05%。主要发现包括动态门控和阅读器训练在记忆注入方面的有效性。
一项对60K参数下Ternary语言模型的受控重新检查表明,基线形状显著影响性能比较,挑战了关于路由Ternary模型优势的先前说法。
一位用户在 AI 论坛上询问 Qwen Flash Next 在 Q2 量化下是否优于 27B 参数模型在 Q4 量化下的表现。
用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。
UkisAI 发布了基于 Qwen 的高效推理大语言模型 Swift 系列,这些模型提供了显著的令牌减少和准确度提升,并支持多种量化选项以供部署。
Qwen3.8-27B-S-experimental 的预览版,一个使用 Mirai S 编解码器的量化 AI 模型,现已在 Hugging Face 上公开可用。它支持在 Apple Silicon 上使用 uzu 和在 NVIDIA 上使用 vLLM 进行推理,并提供性能详情和使用说明。
作者分享了长时间运行的Django基准测试中学到的教训,强调了在评估工作流程稳定性方面的修复,以及更新后的结果,显示Flash Next是表现最佳的模型,现在推理努力级别得到了正确评估。
本文提出一种针对大语言模型的量化鲁棒遗忘学习框架,利用损失景观分析来确保在压缩后有效遗忘的同时维持模型效用。
本文鼓励大家支持 @ViC305,他是DGX社区的关键贡献者,从事AI相关工作,如量化和内核开发,尽管他没有DGX Spark。
本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。
该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。
文章报道了在两块Radeon AI PRO R9700 GPU上使用affinity推理引擎运行DeepSeek-V4-Flash-0731,通过预构建量化和稳定性修复,实现了40-50 tok/s的解码速度。