@MaxForAI: 突发:DeepSeek-V4-Pro-0813还真是发错了模型啊 昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题: 开源版本的模型架构,居然完整对上了之前的 V4…

X AI KOLs Timeline 新闻

摘要

社区发现DeepSeek上传到Hugging Face的V4-Pro-0813开源模型架构实为V4 Flash,仓库下架后重新上传,且部分safetensors权重文件的哈希和大小也发生变化,疑似发布部署失误。

突发:DeepSeek-V4-Pro-0813还真是发错了模型啊 昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题: 开源版本的模型架构,居然完整对上了之前的 V4 Flash,而不是 V4-Pro- preview。 具体是: hidden_size:4096 43 层 256 个 routed experts 64 attention heads 这些参数和 V4-Flash 基本一致。 而正常的 V4 Pro 应该是: hidden_size:7168 61 层 384 个 routed experts 128 attention heads 更蹊跷的是,问题被社区发现之后,Hugging face上的V4-Pro-0813 仓库一度被下架。 随后在北京时间的今天0点左右 DeepSeek 又重新上传了模型,把 config 改回了 Pro 的架构。 事情到这里,本来还能解释成一句:开源的时候复制错 config.json 了。 但后续有人继续检查 Hugging Face 的 commit history,发现重新上传之后,不只是 config 发生变化,部分 safetensors 权重文件的 SHA256 hash 和文件大小也变了。 也就是说,DeepSeek 很可能不只是改了一个配置文件,而是重新处理、导出甚至量化了一部分 checkpoint。 这也让昨天 V4 Pro 0813 发布后出现的各种异常表现,变得更加值得重新审视。 一个 1.6T 级别旗舰模型发布,最后可能栽在了一个错误的deployment上。 模型炼得出来,发布没发明白。 世界真的是一个大草台班子啊
查看原文
查看缓存全文

缓存时间: 2026/08/14 11:31

突发:DeepSeek-V4-Pro-0813还真是发错了模型啊

昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题:

开源版本的模型架构,居然完整对上了之前的 V4 Flash,而不是 V4-Pro- preview。

具体是: hidden_size:4096 43 层 256 个 routed experts 64 attention heads

这些参数和 V4-Flash 基本一致。

而正常的 V4 Pro 应该是:

hidden_size:7168 61 层 384 个 routed experts 128 attention heads

更蹊跷的是,问题被社区发现之后,Hugging face上的V4-Pro-0813 仓库一度被下架。

随后在北京时间的今天0点左右 DeepSeek 又重新上传了模型,把 config 改回了 Pro 的架构。

事情到这里,本来还能解释成一句:开源的时候复制错 config.json 了。

但后续有人继续检查 Hugging Face 的 commit history,发现重新上传之后,不只是 config 发生变化,部分 safetensors 权重文件的 SHA256 hash 和文件大小也变了。

也就是说,DeepSeek 很可能不只是改了一个配置文件,而是重新处理、导出甚至量化了一部分 checkpoint。

这也让昨天 V4 Pro 0813 发布后出现的各种异常表现,变得更加值得重新审视。

一个 1.6T 级别旗舰模型发布,最后可能栽在了一个错误的deployment上。

模型炼得出来,发布没发明白。

世界真的是一个大草台班子啊

相似文章