@TheAhmadOsman: Yannick 在本地 AI 领域的工作深度被严重低估
摘要
Yannick Nick 演示了如何使用 KTransformers 在 2 块 RTX Pro 6000 GPU 上以原生 FP4+FP8 精度运行 DeepSeek V4 Flash,从而在资源受限的系统上实现高效推理。
查看缓存全文
缓存时间: 2026/06/26 20:15
Yannick 在本地 AI 领域的工作深度令人发指,关注度却低得令人发指
Yannick Nick (@keennay):
- DeepSeek V4 Flash - 原生精度(FP4 + FP8)
- 可运行于 2x RTX Pro 6000 GPU + 256 GB DDR5 RAM
- 使用 KTransformers:KVCache-AI 对 SGLang 的 fork,用于 GPU/CPU 内存推理
我有点痴迷于在资源受限的系统上运行应用,以期挤压出
相似文章
在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!
一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。
@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。
@danveloper: https://x.com/danveloper/status/2064387956387758206
一位开发者通过在NVMe SSD上流式传输模型权重,在树莓派5上运行了DeepSeek-V4-Flash,达到了1.3 tokens/秒的速率,功耗仅8瓦,证明了前沿级别的开放权重模型在低成本、离线硬件上的可行性。
我在家运行了(更快的)DeepSeek V4 Pro
用户报告成功使用 ktransformers 在本地运行 DeepSeek V4 Pro 模型,并分享了在不同上下文深度下的详细基准测试结果,展示了改进的推理速度。
@0xSero: Deepseek-V4-Flash 帮助我设置 Nvidia 的 Dynamo 进行分离推理。我已经让这个模型成为…
用户 @0xSero 分享说 Deepseek-V4-Flash 正在帮助他们设置 Nvidia 的 Dynamo 进行分离推理,他们发现它在代理工作流和编程方面非常强大,现在已经在本地使用它替代了 Claude。