更新基准测试:DeepSeek V4 Flash 在 SlopCodeBench(本地)上的表现
摘要
用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。
大家好——我之前在这里发布了一个基准测试——https://www.reddit.com/r/LocalLLaMA/comments/1vbtiy7/deepseek_v4_flash_on_slopcodebench/ 当时使用的是托管 API。此后我一直在折腾量化版本。这是最新的基准测试——https://github.com/michaelasper/benchmarks/blob/main/deepseek-v4-flash-0731-pi-on-slop-code-bench.md 它使用了 antirez q2-q4 imatrix 量化,我把工具从 opencode 换成了 pi。结果非常有趣!在 MacBook M5 Max 上比托管 API 慢得多,但更换工具弥补了部分智能损失。与其他已报告的运行结果对比如下:
| 报告运行 | 服务方式 | 工具 | 严格 | 隔离 | 核心 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731(运行 B) | 本地量化(antirez,更高上限) | pi 0.84.0 | 5/17 (29.4%) | 6/17 | 10/17 |
| Opus 5 | 托管 API | Claude Code | 4/17 (23.5%) | — | — |
| DeepSeek V4 Flash | 托管 API | OpenCode 1.18.10 | 3/17 (17.6%) | 6/17 | 11/17 |
| Opus 4.8 | 托管 API | Claude Code | 1/17 (5.9%) | — | — |
| Sonnet 5 | 托管 API | Claude Code | 1/17 (5.9%) | — | — |
| DeepSeek V4 Flash 0731(运行 A) | 本地量化(unsloth,配置错误的上限) | pi 0.84.0 | 1/17 (5.9%) | 1/17 | 2/17 |
相似文章
@cline:DeepSeek 一小时前悄悄更新了其更新日志,带来了新的 V4-Flash 升级。其新的 Terminal-Bench 分数为 82.…
DeepSeek 悄悄更新了其更新日志,带来了 V4-Flash 升级,将其 Terminal-Bench 分数提升至 82.7,比 4 月预览版提高了 25.8 分。目前仅通过 API 提供,开源权重即将发布。
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
DeepSeek-V4-Flash-0731 在基准测试中现已大幅超越 DeepSeek-V4-Pro-Preview
DeepSeek 的新 V4-Flash-0731 模型在基准测试中的表现现已远远优于 V4-Pro-Preview,标志着该模型系列取得了显著进步。
DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s
一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。