@MaxForAI: 突发:DeepSeek-V4-Pro-0813还真是发错了模型啊 昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题: 开源版本的模型架构,居然完整对上了之前的 V4…
摘要
社区发现DeepSeek上传到Hugging Face的V4-Pro-0813开源模型架构实为V4 Flash,仓库下架后重新上传,且部分safetensors权重文件的哈希和大小也发生变化,疑似发布部署失误。
查看缓存全文
缓存时间: 2026/08/14 11:31
突发:DeepSeek-V4-Pro-0813还真是发错了模型啊
昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题:
开源版本的模型架构,居然完整对上了之前的 V4 Flash,而不是 V4-Pro- preview。
具体是: hidden_size:4096 43 层 256 个 routed experts 64 attention heads
这些参数和 V4-Flash 基本一致。
而正常的 V4 Pro 应该是:
hidden_size:7168 61 层 384 个 routed experts 128 attention heads
更蹊跷的是,问题被社区发现之后,Hugging face上的V4-Pro-0813 仓库一度被下架。
随后在北京时间的今天0点左右 DeepSeek 又重新上传了模型,把 config 改回了 Pro 的架构。
事情到这里,本来还能解释成一句:开源的时候复制错 config.json 了。
但后续有人继续检查 Hugging Face 的 commit history,发现重新上传之后,不只是 config 发生变化,部分 safetensors 权重文件的 SHA256 hash 和文件大小也变了。
也就是说,DeepSeek 很可能不只是改了一个配置文件,而是重新处理、导出甚至量化了一部分 checkpoint。
这也让昨天 V4 Pro 0813 发布后出现的各种异常表现,变得更加值得重新审视。
一个 1.6T 级别旗舰模型发布,最后可能栽在了一个错误的deployment上。
模型炼得出来,发布没发明白。
世界真的是一个大草台班子啊
相似文章
@tianyi: DeepSeek 开源了一些新的代码仓库,使得部署 V4.1 Flash 以及后续的开源模型更加容易…
DeepSeek 开源了新的代码仓库,包括库和工具,以促进 V4.1 Flash 和后续开源模型的部署。
deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
DeepSeek 发布了 DeepSeek-V4-Pro-0813,这是其大型语言模型的新版本,已在 Hugging Face 上提供。
@geekbb: 通过 Hugging Face 用上了 nvidia/GLM-5.2-NVFP4,这是 NVIDIA 基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本。我在想它至少应该比 deepseek-v4-flash 更强吧。 Hug…
NVIDIA 发布了基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本,可通过 Hugging Face 免费层级 API 使用。
@Ryrenz: 炸裂,Hugging Face 把 DeepSeek-R1 的训练全流程完整开源复现了一遍。 GitHub 26.4k star,出自 Hugging Face 官方团队,最权威的一集。 DeepSeek-R1 惊艳全场,但真正的训练配方…
Hugging Face 官方团队完整开源复现了 DeepSeek-R1 的训练全流程(Open-R1 项目),包括数据、训练和评测,在 GitHub 上获得 26.4k star,为行业提供了可复现的推理模型训练教科书。
Weights of Deepseek v4 flash 0731 have been released!!!
DeepSeek released the official DeepSeek-V4-Flash-0731 weights on Hugging Face, superseding the preview version with enhanced agentic capabilities and competitive benchmark results.