需要 DeepSeek V3.2 各量化级别的质量基准信息 [D]
摘要
开发者寻求质量基准,以评估运行时量化对 DeepSeek V3.2 模型性能的影响。
我正在调研一款能在运行时对 DeepSeek V3.2 做量化的产品,想衡量相比无量化时的质量损失。可以跑哪些基准测试?
相似文章
Qwen3.6-27B 量化基准测试
本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。
DeepSeek v4 (Flash) 的运行成本真的极低吗?如果是,原因是什么?
用户询问为什么 DeepSeek v4 Flash(284B 参数)相比于像 Qwen 27B 这样的更小模型运行成本如此之低,质疑这是否源于定价倾销或架构差异。答案可能涉及其 MoE 架构和高效的推理技术。
我在家运行了(更快的)DeepSeek V4 Pro
用户报告成功使用 ktransformers 在本地运行 DeepSeek V4 Pro 模型,并分享了在不同上下文深度下的详细基准测试结果,展示了改进的推理速度。
DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]
DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。
有没有人测试过量化对不同能力的影响?我的结果令人惊讶。
作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。