@TheAhmadOsman: Yannick 在本地 AI 领域的工作深度被严重低估

X AI KOLs Timeline 模型

摘要

Yannick Nick 演示了如何使用 KTransformers 在 2 块 RTX Pro 6000 GPU 上以原生 FP4+FP8 精度运行 DeepSeek V4 Flash,从而在资源受限的系统上实现高效推理。

Yannick 在本地 AI 领域的工作深度被严重低估
查看原文
查看缓存全文

缓存时间: 2026/06/26 20:15

Yannick 在本地 AI 领域的工作深度令人发指,关注度却低得令人发指

Yannick Nick (@keennay):

  • DeepSeek V4 Flash - 原生精度(FP4 + FP8)
  • 可运行于 2x RTX Pro 6000 GPU + 256 GB DDR5 RAM
  • 使用 KTransformers:KVCache-AI 对 SGLang 的 fork,用于 GPU/CPU 内存推理

我有点痴迷于在资源受限的系统上运行应用,以期挤压出

相似文章

@danveloper: https://x.com/danveloper/status/2064387956387758206

X AI KOLs Timeline

一位开发者通过在NVMe SSD上流式传输模型权重,在树莓派5上运行了DeepSeek-V4-Flash,达到了1.3 tokens/秒的速率,功耗仅8瓦,证明了前沿级别的开放权重模型在低成本、离线硬件上的可行性。

我在家运行了(更快的)DeepSeek V4 Pro

Reddit r/LocalLLaMA

用户报告成功使用 ktransformers 在本地运行 DeepSeek V4 Pro 模型,并分享了在不同上下文深度下的详细基准测试结果,展示了改进的推理速度。