@YRSM_Simon: 别被 Max 这名字“骗”了。 同一个任务我测试了100遍。 deepseek v4 flash max 比 medium 快 26%,token 省 34%,质量评分高83%。 max 虽然想得多,但是轮数也会更少。 (每个任务都不一样…
摘要
作者对同一任务测试了100遍,发现DeepSeek V4 Flash Max比Medium版本快26%、节省34% token,且质量评分高83%;Max虽思考更多但轮数更少。
查看缓存全文
缓存时间: 2026/08/14 09:36
别被 Max 这名字“骗”了。
同一个任务我测试了100遍。
deepseek v4 flash max 比 medium 快 26%,token 省 34%,质量评分高83%。
max 虽然想得多,但是轮数也会更少。
(每个任务都不一样的,具体配置需要自行测试) https://t.co/ALj5llIOf6
相似文章
@jakevin7: DeepSeek cache hit 命中率 95%,舒服了。 Maka 在最新一轮的长程任务 Deepseek 模型下的表现太出色了。 全跑完接近 18 小时,接近 4 亿 token,33块消耗。 Make builder 们太给力了…
DeepSeek cache hit 高达95%,Maka 桌面AI工作台在长程任务中表现出色,支持多种模型和工具,开源且本地优先。
@FuckAnthropic: 做了对比分析,综合看,DeepSeek V4 Flash-0731 大致是一个 Opus 4.7 - 4.8 之间水平的模型,以极小激活规模进入了前沿 Agent 模型竞争区间,用约 1/12~1/60 的 token 成本进入前沿 Ag…
作者对比分析认为,DeepSeek V4 Flash-0731 在极小激活规模下达到 Opus 4.7-4.8 水平,以极低 token 成本进入前沿 Agent 模型区间,整体超越 GLM-5.2,但短板仍是困难仓库级编程和长时程工程。
@jakevin7: Maka 的 Harness 工程让 DeepSeek Flash 的测试集效果接近了 GLM-5.2 的水平 ----------------------------------- maka + DeepSeek Flash V4,te…
Maka的Harness工程通过改进self-check机制,使DeepSeek Flash V4在terminal-bench样本集上达到接近GLM-5.2的评测效果,仅用4元人民币和97.5%的缓存命中率完成10道编程Agent任务。
@FinanceYF5: 1/ 有人用 Fable 5 跑了 3 个任务。 $200 的 Max 会员,5 小时额度干没 73%。 他说懵了。不是因为贵——是因为 Opus 4.8 从来没干出过这种东西。 一个 Thread 讲清楚
用户使用Fable 5模型运行3个任务,耗尽了Max会员5小时额度的73%,对比Opus 4.8从未如此消耗资源,引发讨论。
@YRSM_Simon: 让 Claude Fable 5 和本地跑的 DeepSeek V4 Flash(DGX Spark,thinking 开满)下国际象棋,下出了年度最离谱对比: Fable:每步思考 ~2,600 token,50 秒落子 V4 Flas…
作者让 Claude Fable 5 和本地运行的 DeepSeek V4 Flash 下国际象棋,结果 DeepSeek 在长思考下每步消耗数万 token 甚至超时,但局面反而占优,一局耗时 5 小时尚未结束。