@TheAhmadOsman: 澄清一下,OMP 有 97.5% 的缓存命中率。我的大部分使用都是自托管模型,并非所有推理设置都正确报告了遥测数据,所以…
摘要
一位用户澄清 OMP 有 97.5% 的缓存命中率,并讨论了自托管 DeepSeek V4 Flash 模型的使用,解决了对推理设置中缓存性能的担忧。
查看缓存全文
缓存时间: 2026/08/23 23:43
需要澄清的是,OMP的缓存命中率实际达到97.5%
我目前主要使用自托管模型,并非所有推理配置都能正确上报token统计数据,这就是原始截图中缺少部分数据的原因。
以下是近几天通过OMP运行的DeepSeek V4 Flash 0731模型数据:https://t.co/BC5EL5Sxet
Theo - t3.gg (@theo): 天呐,OMP的缓存机制真有这么差吗?
相似文章
我使用GLM、Kimi、Opus和GPT测试了DeepSeek Harness,以查看提示缓存是否仍能与其他模型一起工作
本文测试了DeepSeek Harness在使用其他AI模型时是否保持高提示缓存率,发现GLM和Kimi实现了97-99%的缓存重用,而Opus没有显示缓存活动,GPT测试失败。
@ciruai:在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。在中等长度上下文中获得约15 TPS……
在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。
DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行
一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。
@Michaelzsguo: KV缓存是模型在生成期间的工作记忆。随着上下文窗口变长,模型必须保留更多…
DeepSeek的KV缓存压缩创新,包括MLA和CSA/HCA,将KV缓存大小减少了93%,实现了高效的长上下文推理和基于SSD的缓存,正如antirez的ds4.c项目所展示的那样。
@TheAhmadOsman: OMP 搭配 DeepSeek V4 Flash 0731 实在是太棒了
一条推文,称赞 OMP 与 DeepSeek V4 Flash 0731 结合的质量。