NInfer RTX 4090 for Qwen 3.8 27B 更新 - 最高支持25万-35万令牌上下文在显存中

Reddit r/LocalLLaMA 工具

摘要

作者已更新其 NInfer 分叉,添加了 rk2v4-e8 量化选项用于 KV 缓存,使得在单张 RTX 4090 上实现最高25万-35万令牌上下文,无需溢出到系统内存,并进行了优化以提升生成速度。

我对我的 NInfer 分叉进行了一些改进,添加了用于 KV 缓存的 rk2v4-e8 量化选项,根据配置(如视觉、MTP 等),在单张 RTX 4090 上可以达到最高25万-35万令牌的上下文窗口,无需溢出到系统内存。在较低上下文窗口运行时,我还进行了一些优化,以达到约80-160令牌/秒的生成速度,适用于代码、数学等重复性工作负载。如果出现明显的运行时问题,请告知;到目前为止,它似乎经受住了我施加的各种复杂工作负载。希望这次版主不会为了置顶帖而删除它,因为在那里面很容易被淹没。来源:https://github.com/UDPSendToFailed/ninfer-4090
查看原文

相似文章