DeepSeek-V4-Flash-0731:当“Low”高于“High”
摘要
一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。
我决定用 DeepSeek-V4-Flash-0731 测试几个问题。本地我运行的是 Unsloth 的 UD-Q2_K_XL 量化版本。在看到结果出人意料的形态后,我用 DeepSeek 官方 API 进行了测试,以确认我没有做错什么。对于使用 OpenRouter 的用户,请注意那里有一个严重 bug,会破坏推理努力模式。我是在尝试验证本地结果时遇到这个 bug 的。DeepSeek-V4-Flash-0731 支持四种不同的努力模式:无推理、低、高和最大。我们也可以看到这些模式是如何传递给模型的。正如我发现的,低模式出人意料地冗长。每种模式平均 20 次请求,以下是每种模式使用的 token 数量:
模式 本地 Q2 总计 / 推理 / 最终 DeepSeek API 总计 / 推理 / 最终
无 801.7 / 0 / 801.7 948.9 / 0 / 948.9
低 1,227.5 / 874.4 / 353.2 1,349.2 / 889.6 / 459.7
高 605.8 / 410.5 / 195.4 481.5 / 253.9 / 227.7
最大 1,301.4 / 1,031.8 / 269.6 698.7 / 473.9 / 224.8
我真希望 DeepSeek 和 Artificial Analysis 发布了所有努力模式的基准测试,而不仅仅是最强模式。
相似文章
DeepSeek V4 Pro 0813(在 OpenRouter 上)
Simon Willison 报道了 DeepSeek V4 Pro 0813 的发布,该模型可通过 OpenRouter 上的 API 使用,并指出了可能开放的权重以及不同推理等级之间的显著差异。
为何 Qwen 3.8 27b 没有“高”推理强度模式?
本文探讨了 Qwen 3.8 27b 模型为何缺少“高”推理强度模式,并指出“中等”与“极高”设置之间存在巨大差距。
Qwen3.8-27B中'medium'和'xhigh'推理努力度的区别确实非常惊人。
用户观察到,在Qwen3.8-27B中将推理努力度设置为'xhigh'时,生成的思考标记比'medium'多得多,标记使用量差异显著。
DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。
还有人觉得 DeepSeek-V4-Flash 在非编程任务上不可靠吗?
一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。