DeepSeek-V4-Flash-0731:当“Low”高于“High”

Reddit r/LocalLLaMA 模型

摘要

一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。

我决定用 DeepSeek-V4-Flash-0731 测试几个问题。本地我运行的是 Unsloth 的 UD-Q2_K_XL 量化版本。在看到结果出人意料的形态后,我用 DeepSeek 官方 API 进行了测试,以确认我没有做错什么。对于使用 OpenRouter 的用户,请注意那里有一个严重 bug,会破坏推理努力模式。我是在尝试验证本地结果时遇到这个 bug 的。DeepSeek-V4-Flash-0731 支持四种不同的努力模式:无推理、低、高和最大。我们也可以看到这些模式是如何传递给模型的。正如我发现的,低模式出人意料地冗长。每种模式平均 20 次请求,以下是每种模式使用的 token 数量: 模式 本地 Q2 总计 / 推理 / 最终 DeepSeek API 总计 / 推理 / 最终 无 801.7 / 0 / 801.7 948.9 / 0 / 948.9 低 1,227.5 / 874.4 / 353.2 1,349.2 / 889.6 / 459.7 高 605.8 / 410.5 / 195.4 481.5 / 253.9 / 227.7 最大 1,301.4 / 1,031.8 / 269.6 698.7 / 473.9 / 224.8 我真希望 DeepSeek 和 Artificial Analysis 发布了所有努力模式的基准测试,而不仅仅是最强模式。
查看原文

相似文章

DeepSeek V4 Pro 0813(在 OpenRouter 上)

Simon Willison's Blog

Simon Willison 报道了 DeepSeek V4 Pro 0813 的发布,该模型可通过 OpenRouter 上的 API 使用,并指出了可能开放的权重以及不同推理等级之间的显著差异。

DeepSeek V4 Flash 0731

Hacker News Top

DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。