@mitsuhiko: 而且 ds4 SSD 缓存表现非常出色。这是在服务器关机后继续一个已经处理了 63k 令牌的会话……
摘要
一名用户反馈,在恢复包含 63k 令牌的长周期 LLM 推理会话时,ds4 SSD 缓存的性能表现良好,并指出启动时间尚可接受。
而且 ds4 SSD 缓存表现非常出色。这是在服务器关机后继续一个已经处理了 63k 令牌的会话!是的,启动确实需要一点时间,但并不糟糕!https://t.co/aVkS6uAdvY
查看缓存全文
缓存时间: 2026/05/12 00:46
而且 DS4 的 SSD 缓存效果很棒。这是在服务器关机后恢复的会话,当时已经积累了 6.3 万个 token!启动确实需要一点时间,但并不糟糕!https://t.co/aVkS6uAdvY
相似文章
@antirez: DS4 正在 DGX Spark (GB10 / CUDA) 上运行,目前为私有分支。12 tokens/sec,此系统的内存带宽受限……
Antirez 报告了在 DGX Spark (GB10) 上对 DS4 推理进行的基准测试,指出生成速度为 12 tokens/sec,预填充性能较高,并计划在该代码库成熟后将其合并。
@ttasanen: 刚刚在我的 Mac Studio M3 Ultra 256GB 上运行了 @antirez 开发的 DS4,天哪,真的令人印象深刻。一个简洁、专为……
DS4 是由 antirez 开发的专业推理引擎,专为在高端 Mac 硬件上本地运行 DeepSeek V4 Flash 而设计,具有优化的 KV 缓存处理和 100 万上下文支持。
@techNmak: 你的LLM推理正在消耗50%的计算资源在已经完成的工作上。如果你正在运行RAG或多轮对话,……
LMCache是一个开源库,它使KV缓存持久化并可在请求之间共享,消除了RAG和多轮对话工作负载中的重复计算,实现了高达15倍的吞吐量提升和3-10倍的首令牌时间减少。
@Tono_Ken3: 哦天哪,我成功了!它成功了——DeepSeek-V4-Flash-FP8 8 parallel aggregate 400TPS!!本地LLM革命 耶耶耶耶耶!哈哈
在本地硬件上使用8个并行聚合以DeepSeek-V4-Flash-FP8实现了每秒400个token,标志着本地LLM推理的一个重要里程碑。
@Michaelzsguo: 发现了一个对你的本地LLM推理优化很有用的工具:https://kvcache.ai/tools/kv-cache-ca…
一条推文分享了来自KVCache.ai的KV缓存大小计算器,这是一个用于估算本地LLM推理中KV缓存内存使用量的工具,并强调DeepSeek V4 Pro的100万token仅使用5GB内存。