@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…
摘要
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。
查看缓存全文
缓存时间: 2026/08/25 02:02
DeepSeek-V4-Flash在Mac M5 Pro上运行速度达5.71 token/s。
每天,都有更强大的模型在消费级硬件上运行。
而这已不再是玩具级模型:我们无需依赖外部GPU,就能在本地运行大量智能应用。
腾讯云 (@tencentcloud): 从稠密模型到122B及295B的MoE架构,本地推理应当利用你现有的硬件实现——而非依赖数据中心。 Palm-Infra现已开源。该框架由腾讯PalmAI团队打造,为Apple Silicon带来Metal、CPU SIMD与SSD专家分载技术支持。
相似文章
DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行
一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。
你可以在 Mac (M3 Max, 96GB) 上运行 Deepseek 4 flash
介绍如何在配备 96GB 内存的 Mac M3 Max 上,使用 Antirez 的 ds4 引擎和 SSD 流式传输运行 DeepSeek 4 flash,实现约每秒 12 token 的推理速度。
@Saboo_Shubham_:开源 AI 势头强劲。DeepSeek v4 Flash 是一款准前沿模型,拥有高达 100 万的上下文窗口。它可本地…
文章重点介绍了 DeepSeek v4 Flash,这是一款拥有 100 万上下文窗口的准前沿开源模型,并指出其能够通过 2 比特量化在 128GB 内存的 Mac 上本地运行。
DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps
一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。
@danveloper: https://x.com/danveloper/status/2064387956387758206
一位开发者通过在NVMe SSD上流式传输模型权重,在树莓派5上运行了DeepSeek-V4-Flash,达到了1.3 tokens/秒的速率,功耗仅8瓦,证明了前沿级别的开放权重模型在低成本、离线硬件上的可行性。