@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…

X AI KOLs Timeline 新闻

摘要

这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。

DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。 每天,我们都能在消费级硬件上运行更好的模型。 而且我们不再谈论玩具模型了:我们已经可以运行大量智能,而无需支付外部 GPU 的费用。
查看原文
查看缓存全文

缓存时间: 2026/08/25 02:02

DeepSeek-V4-Flash在Mac M5 Pro上运行速度达5.71 token/s。

每天,都有更强大的模型在消费级硬件上运行。

而这已不再是玩具级模型:我们无需依赖外部GPU,就能在本地运行大量智能应用。

腾讯云 (@tencentcloud): 从稠密模型到122B及295B的MoE架构,本地推理应当利用你现有的硬件实现——而非依赖数据中心。 Palm-Infra现已开源。该框架由腾讯PalmAI团队打造,为Apple Silicon带来Metal、CPU SIMD与SSD专家分载技术支持。

相似文章

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。

@danveloper: https://x.com/danveloper/status/2064387956387758206

X AI KOLs Timeline

一位开发者通过在NVMe SSD上流式传输模型权重,在树莓派5上运行了DeepSeek-V4-Flash,达到了1.3 tokens/秒的速率,功耗仅8瓦,证明了前沿级别的开放权重模型在低成本、离线硬件上的可行性。