@TheAhmadOsman: 澄清一下,OMP 有 97.5% 的缓存命中率。我的大部分使用都是自托管模型,并非所有推理设置都正确报告了遥测数据,所以…

X AI KOLs Timeline 工具

摘要

一位用户澄清 OMP 有 97.5% 的缓存命中率,并讨论了自托管 DeepSeek V4 Flash 模型的使用,解决了对推理设置中缓存性能的担忧。

澄清一下,OMP 有 97.5% 的缓存命中率 我的大部分使用都是自托管模型,并非所有推理设置都正确报告了遥测数据,这就是为什么在原始截图中缺失的原因 这些是过去几天通过 OMP 运行的 DeepSeek V4 Flash 0731 https://t.co/BC5EL5Sxet
查看原文
查看缓存全文

缓存时间: 2026/08/23 23:43

需要澄清的是,OMP的缓存命中率实际达到97.5%

我目前主要使用自托管模型,并非所有推理配置都能正确上报token统计数据,这就是原始截图中缺少部分数据的原因。

以下是近几天通过OMP运行的DeepSeek V4 Flash 0731模型数据:https://t.co/BC5EL5Sxet

Theo - t3.gg (@theo): 天呐,OMP的缓存机制真有这么差吗?

相似文章

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。