我让Codex优化了oMLX上的DeepSeek V4 Flash 8-bit MLX,实现了约1.6倍的预填充速度和3倍的解码加速。
摘要
作者使用Codex优化了oMLX上的DeepSeek V4 Flash 8-bit MLX,实现了约1.6倍的预填充速度和3倍的解码加速。
相似文章
如何在M3 Ultra上让DeepSeek V4 Flash快12倍
作者通过优化内核和实现有效的缓存策略,在Mac Studio M3 Ultra上将DeepSeek V4 Flash的速度提升了12倍,将聊天轮次延迟从6-20秒降低到1.6秒。
@malikwas1f:四行修复让 DeepSeek-V4-Flash 的预填充速度在 10K 下从 127 提升至 312 t/s,在 40K 下从 91 提升至 283 t/s,并通过了召回率检查……
据报道,一个四行修复将 DeepSeek-V4-Flash 的预填充速度从 10K 上下文下的 127 t/s 提升至 312 t/s,从 40K 上下文下的 91 t/s 提升至 283 t/s,解码速度保持不变。该补丁通过 club-3090 项目分享,该项目用于在 RTX 3090 上提供 LLM 服务。
DeepSeek V4 Flash on a Single AMD MI300X
This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.
DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps
一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。
[Deepseek-V4-Flash-0731] 在单张RTX5090 + DDR5桌面配置下,通过VLLM CPU/内存卸载实现完整1M上下文,~800 tps预填充 & 15+ tps解码 [智能体编码]
关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。