标签
Michael Gannotti 分享道,在完成模型训练后,他已将 DeepSeek 的 V4 Flash AI 模型在其 NVIDIA DGX 集群上重新上线,这使他能够恢复本地推理以运行智能体。
本文介绍了 DeepSeek V4 Flash 0731 在 Strix Halo 硬件上的基准测试结果,展示了不同草稿模型和 n_max 设置下的性能,得出结论 n_max=3 提供了最佳的速度平衡。
本文介绍了Gonka,一个去中心化的推理网络,允许通过OpenAI兼容接口访问具有完整1M上下文的V4-Flash AI模型,无需本地GPU所有权。
一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。
作者评论DeepSeek V4 Flash降价,认为这能让更多厂商活下去,并调侃称大模型厂商该叫梁文峰为“梁圣”。
用户询问通过 Colibri 运行 Deepseek V4 Flash 的性能数据,重点关注高 VRAM 配置、长上下文预填充以及面向智能体工作负载的 token 生成速度。
DeepSeek V4 Flash 已成为 Ollama 在 token 使用量上增长最快的模型,并且是本周 OpenRouter 上最受欢迎的模型,现在可通过多个提供商在 Pi 中使用。
据称 DeepSeek V4 Flash 仅有2840亿参数,激活参数仅130亿,对中美模型厂商构成效率冲击。
这条推文建议,通过 Hermes agent 运行 DeepSeek v4 Flash 比测试过的任何其他工具链都能生成更好的输出文件。
建议在 DeepSeek 自己的 harness 发布之前,使用新的 DeepSeek v4 Flash 模型搭配 Pi harness,该组合与许多近期开源模型都能很好地配合。
一条推文指出,DeepSeek V4-Flash在Artificial Analysis Intelligence Index上获得了50分,接近五个月前GPT-5.4的51分,并预测本地模型将在两年内成为主流选择。
Mike Bradley 分享了基准测试结果,声称 DeepSeek V4 Flash 0731 是当前190GB显存系统的最佳(SOTA)选择,在质量上匹敌甚至超过 Unsloth 3-bit Qwen3.5-397B,而运行速度大约快3倍。
讨论了DeepSeek V4-Flash的每token价格与每项任务总成本的对比,引用了一份报告,称DeepSeek完成基准测试任务的成本比Fable低105倍。
Unsloth 预告了即将在 Hugging Face 上发布的 DeepSeek V4 Flash GGUF 量化模型。
DeepSeek-V4-Flash 官方 API 现已进入公开测试阶段,智能体能力大幅升级,基准测试分数超越 V4-Pro-Preview。
对 DeepSeek V4 Flash 0731 的分析,涵盖其智能、性能以及与其他 AI 模型的定价对比。
DeepSeek 悄悄更新了其更新日志,带来了 V4-Flash 升级,将其 Terminal-Bench 分数提升至 82.7,比 4 月预览版提高了 25.8 分。目前仅通过 API 提供,开源权重即将发布。
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
DeepSeek officially released DeepSeek-V4-Flash on the API in public beta, with significantly enhanced agent capabilities, new benchmark results, and native support for the Responses API and Codex integration.