@ciruai:在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。在中等长度上下文中获得约15 TPS……

X AI KOLs Timeline 新闻

摘要

在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。

在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。 在中等长度上下文中获得约15 TPS,对于这么聪明的模型来说,这个速度确实很实用。 284B参数的MoE(混合专家)模型,A13B活跃参数。 在有人说“这太慢”之前,请记住:这是在一台价值3000美元的机器上运行的。要让这类模型跑得快,通常意味着花费超过25000美元(如果你自己组装的话)。 成就不在于击败数据中心GPU。 成就在于能够完全在本地运行它。
查看原文
查看缓存全文

缓存时间: 2026/06/18 16:19

在搭载 128GB 内存的 AMD Ryzen AI Max+ 395 Strix Halo 上测试 DeepSeek v4 Flash。

在相当长的上下文下,获得了约 15 TPS 的推理速度,坦白讲,对于这么智能的模型来说已经非常实用了。

284B 参数 MoE 架构,13B 活跃参数。

在有人抱怨“这太慢了”之前,请记住:这是在价值 3000 美元的机器上运行的。要让这类模型跑得快,通常意味着要花费超过 25000 美元(如果你自己组装的话)。

成就不是击败数据中心级 GPU。

成就在于:能本地运行它本身。

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。

DeepSeek V4 Flash on a Single AMD MI300X

Hacker News Top

This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。