还有人觉得 DeepSeek-V4-Flash 在非编程任务上不可靠吗?
摘要
一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。
(我不是母语者,这段文字是我自己写的,请多包涵)我真的很想喜欢 DeepSeek-V4-Flash-0731。但它存在一些严重缺陷,与其在智能基准测试中的高分并不相符。这些缺陷使它除了编程之外,可能在其他任何任务上都毫无用处。它会在看似微小却至关重要的细节上出错,也会在一些本该轻松解决的更明显任务上失败。这些错误使它变得非常不可靠,以至于我连总结文本或写信这类最简单的办公任务都不敢交给它。也许是我哪里做错了。下面提到的有些问题,对于这种规模的 LLM 来说似乎不太正常。说清楚一点:我希望这个模型能行。它比 Gemma-4-31B 更快,总参数量是后者的 8 倍。它擅长深入思考,如果给予联网搜索权限,做研究也表现出色。但在语言方面,它不仅败在“优美措辞”上,连从上下文中提取相关概念也做不好。这些方面似乎不在基准测试的考察范围内,但在日常办公中却是必不可少的。用例子来解释更容易。下面我给大家展示三个例子。
能力一:包含相关信息同时保持简洁
给定一段文本用于生成会议记录。DeepSeek-V4-Flash-0731:“Spreading irregular income over the year to make sure the essentials are available every month.” Gemma-4-31B:“Concept: The financial investments are designed to cover only part of the needs. The remaining gap will be filled by averaging the irregular income from self-employment throughout the year.” DeepSeek-V4-Flash-0731 的版本遗漏了存在两个收入来源这一信息。所以,尽管它指出了本质(问题所在),但这点不够清晰,因为它只涵盖了故事的一部分。Gemma 似乎有能力理解本质,并用简洁而精准的优美措辞将其表达出来。看看“by averaging the irregular income”,只用“by averaging”两个词就非常优雅地说清了发生的事情。DeepSeek 做不到这一点,更糟糕的是,它遗漏了金融投资是成本覆盖的一部分这一背景。这不仅是“优美”语言的问题(我们知道 Gemma 擅长语言),也是“概念理解”或“判断什么才相关”的问题。
能力二:理解说话人是谁
给定一段语音消息的文字转录和问题。“What would be her best option? How should she handle the situation? What are her possibilities? Please find the best way forward.” DeepSeek-V4-Flash-0731:它把整个回答写得好像我就是发那条语音消息并需要被称呼的人。鉴于问题中包含“her”,而且两条语音消息的标题分别是“Voice message 1 of the person”和“Voice message 2 of the person”,这是我无法接受的错误。在追问之下,它试图解释在回答中用“you”而不是“she”的原因:语音转录是以“I”的人称在说话,而语音消息占据了上下文的很大一部分,所以它过于看重“I”是提问者,从而假设是我在提问。但我明确写了“What could be her best option”,而且从标题就能清楚看出那些消息是另一个人的。DeepSeek 在这里失败了,这种失败是我无法接受的。AI 需要理解上下文,而不是被大量以“I”书写的文本搞糊涂。Gemma-4-31B:这里没有问题。它清楚地理解到,提出请求的人与语音消息中的说话人并非同一人。
能力三:不被次要短语搞糊涂
DeepSeek-V4-Flash-0731 被消息的开头搞糊涂了:“Hi, hi. So, Jon, his message is kind of funny. They’re currently up north, ...”仅仅因为“So, John, ...”可能是一种问候,它就假设整段 5 段的文字都是写给 John 的,尽管其余文本都在说“he”。Gemma-4-31B:从整个上下文理解出“So, John”是背景信息,而不是问候。它明白“John”不是收信人,而是被谈论的人。
结论
DeepSeek-V4-Flash 有 2840 亿参数。我以为它至少在这些领域能和 Gemma-4-31B 处于同一水平。语言不一定要像 Gemma-4 那样优美,但我原本期望 DeepSeek 知道如何纳入所有相关信息,或者正确理解上下文,然而令我惊讶的是,它做不到。
相似文章
DeepSeek-V4 Flash 实际表现如何?
对 DeepSeek-V4 Flash 的性能和能力的评估,评估其实际有效性。
DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
DeepSeek v4 Flash 能力显著提升
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。
DeepSeek V4 Flash GA 在 DeepSWE 上排名与 Sonnet 5 和 Grok 4.5 相同
DeepSeek 宣布推出 V4 Flash GA,声称其在 DeepSWE 基准测试上与 Sonnet 5 和 Grok 4.5 相当,但该说法尚未得到验证。