在两个独立云区域通过公共WAN使用推测解码+CUDA图实现Qwen2.5-7B上28 TPS [P]
摘要
分布式LLM推理框架ShardFlow通过推测解码与CUDA图缓解WAN延迟,在云区域间对Qwen2.5-7B实现28 TPS。
过去几个月一直在构建ShardFlow——一个分布式LLM推理框架,它能将任何HuggingFace Transformer拆分到N台GPU机器上,并利用神经推测解码处理WAN延迟。基准测试设置如下:两个T4节点分别位于GCP的不同区域(爱荷华+俄勒冈),通过位于俄亥俄州的AWS EC2 TCP中继器通信。公共互联网上往返延迟约86ms。这里推测解码的关键洞察是:WAN延迟不再是每个token的成本,而是每轮的成本。当K=8草稿生成时,每轮往返实际提交4.07个token而非1个。在86ms RTT下这具有重要意义。Qwen2.5-7B上的数据:非推测基线:4.92 TPS;神经草稿生成器(急切模式):14.3 TPS峰值 + 草稿生成器CUDA图:28.10 TPS峰值 / 20.31 TPS均值。同样两个节点测试NF4 4位量化的Qwen2.5-14B:14.43 TPS均值。最令我惊讶的v2.1修复:草稿生成原本从Python循环中每轮启动约1500个CUDA内核。每个内核耗时2-5微秒,Python启动开销8-10微秒。GPU有65%时间处于空闲状态。通过CUDA图捕获完整的0.5B前向传播并使用单次驱动调用重放,草稿生成延迟从112ms降至25ms。技术栈中的其他优化:零拷贝Rust TCP中继器、StaticCache + 就地KV回滚以确保图兼容性、元设备模型分片以避免将15GB数据加载到CPU内存。代码仓库:https://github.com/rautaditya2606/Shardflow 欢迎就推测解码实现或CUDA图相关细节提问。
相似文章
@Tono_Ken3: 在GPU上驱动Qwen3.6-27b(100 TPS),同时在CPU上驱动Hy3-299B(25 TPS),本地LLM推理计算新时代的曙光…
演示同时在GPU上以100 TPS运行Qwen3.6-27b,在CPU上以25 TPS运行Hy3-299B,标志着本地LLM推理的一个里程碑。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
@Oluwaphilemon1: Qwen3.8-27B at 56 tok/s on a 9-year-old GPU. Let that sink in. The GPU? NVIDIA V100 32GB. A card that launched at aroun…
在NVIDIA V100 GPU上实现Qwen3.8-27B模型每秒56个令牌的推理速度,展示了使用推测解码技术在旧硬件上进行经济高效的本地AI部署。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。
我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。