需要 DeepSeek V3.2 各量化级别的质量基准信息 [D]
摘要
开发者寻求质量基准,以评估运行时量化对 DeepSeek V3.2 模型性能的影响。
我正在调研一款能在运行时对 DeepSeek V3.2 做量化的产品,想衡量相比无量化时的质量损失。可以跑哪些基准测试?
相似文章
我们对 DeepSeek V4 0731 进行了量化,并在 8× RTX 5090 上与其他流行的量化版本进行了基准测试
作者对 DeepSeek V4 0731 进行量化,修复了会导致基线偏差的 FP8 降转换问题,并在 8× RTX 5090 上对 38 个量化文件进行基准测试,展示了依赖 GPU 的结果和基于文件大小的比较。
Deepseek V4 Flash 2-bit 量化是我能在本地运行且在此 SQL 基准测试中达到 100% 的首个模型
一位用户报告称,DeepSeek V4 Flash 以 2-bit 量化 GGUF 形式在双 RTX 3080 上运行,是首个在真实世界 SQL 基准测试中取得 100% 得分的本地模型,与 Opus 4.7 和 GPT-5.5 等前沿模型持平。
Qwen 3.8 27b 对比 Deepseek Flash
这篇文章对比了开源AI模型Qwen 3.8 (27B) 和 Deepseek Flash,讨论了基准测试,并寻求用户经验以评估它们的性能。
DeepSeek-V3 技术报告
DeepSeek-V3 是一个参数高效的混合专家(MoE)语言模型,总参数为 671B,在训练仅需 2.788M H800 GPU 小时的情况下,实现了与领先闭源模型相当的性能。
计划花费约100美元对Qwen3.8-27B的不同量化版本和KV缓存进行基准测试,并在开始前寻求意见
作者计划花费100美元使用云GPU对Qwen3.8-27B模型进行基准测试,包括不同的量化级别和KV缓存设置,重点关注编码和智能体任务,为本地AI爱好者提供有用数据,并寻求社区对测试方法的意见。