更新基准测试:DeepSeek V4 Flash 在 SlopCodeBench(本地)上的表现

Reddit r/LocalLLaMA 模型

摘要

用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。

大家好——我之前在这里发布了一个基准测试——https://www.reddit.com/r/LocalLLaMA/comments/1vbtiy7/deepseek_v4_flash_on_slopcodebench/ 当时使用的是托管 API。此后我一直在折腾量化版本。这是最新的基准测试——https://github.com/michaelasper/benchmarks/blob/main/deepseek-v4-flash-0731-pi-on-slop-code-bench.md 它使用了 antirez q2-q4 imatrix 量化,我把工具从 opencode 换成了 pi。结果非常有趣!在 MacBook M5 Max 上比托管 API 慢得多,但更换工具弥补了部分智能损失。与其他已报告的运行结果对比如下: | 报告运行 | 服务方式 | 工具 | 严格 | 隔离 | 核心 | |---|---|---|---|---|---| | DeepSeek V4 Flash 0731(运行 B) | 本地量化(antirez,更高上限) | pi 0.84.0 | 5/17 (29.4%) | 6/17 | 10/17 | | Opus 5 | 托管 API | Claude Code | 4/17 (23.5%) | — | — | | DeepSeek V4 Flash | 托管 API | OpenCode 1.18.10 | 3/17 (17.6%) | 6/17 | 11/17 | | Opus 4.8 | 托管 API | Claude Code | 1/17 (5.9%) | — | — | | Sonnet 5 | 托管 API | Claude Code | 1/17 (5.9%) | — | — | | DeepSeek V4 Flash 0731(运行 A) | 本地量化(unsloth,配置错误的上限) | pi 0.84.0 | 1/17 (5.9%) | 1/17 | 2/17 |
查看原文

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。