Deepseek,请解释一下你们是如何让一个300B参数的模型比9B参数的模型便宜那么多的?
摘要
一位Reddit用户询问DeepSeek如何让一个300B参数的模型比9B参数的模型更便宜,引发了关于效率和成本的讨论。
https://preview.redd.it/tjbwkmn4djgh1.png?width=1489&format=png&auto=webp&s=d11ec03569d082cdaf806c131b5be19e407187dd 如何?
相似文章
DeepSeek v4 (Flash) 的运行成本真的极低吗?如果是,原因是什么?
用户询问为什么 DeepSeek v4 Flash(284B 参数)相比于像 Qwen 27B 这样的更小模型运行成本如此之低,质疑这是否源于定价倾销或架构差异。答案可能涉及其 MoE 架构和高效的推理技术。
@che_shr_cat: 1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过扩展其搜索…就能击败1,000B模型呢?
探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。
deepseek-ai/DeepSeek-V4-Pro-DSpark
DeepSeek 发布了其 V4 系列的预览版本,包括 DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 上下文,并采用混合注意力、流形约束超连接和 Muon 优化器。
@scaling01: DeepSeek 刚刚将其推理成本降低约5倍,吞吐量达50 TPS
DeepSeek 已将推理成本降低约5倍,同时保持每秒50个token的吞吐量。
@rohanpaul_ai: 按模型规模划分的下载份额:DeepSeek vs Qwen。DeepSeek在250B+段占主导(47%),而Qwen在10B以下领先…
下载份额对比显示,DeepSeek在250B+段占主导(47%),而Qwen在10B以下段领先(44%),凸显了两个模型家族之间的互补专业化。