NInfer RTX 4090 for Qwen 3.8 27B 更新 - 最高支持25万-35万令牌上下文在显存中
摘要
作者已更新其 NInfer 分叉,添加了 rk2v4-e8 量化选项用于 KV 缓存,使得在单张 RTX 4090 上实现最高25万-35万令牌上下文,无需溢出到系统内存,并进行了优化以提升生成速度。
我对我的 NInfer 分叉进行了一些改进,添加了用于 KV 缓存的 rk2v4-e8 量化选项,根据配置(如视觉、MTP 等),在单张 RTX 4090 上可以达到最高25万-35万令牌的上下文窗口,无需溢出到系统内存。在较低上下文窗口运行时,我还进行了一些优化,以达到约80-160令牌/秒的生成速度,适用于代码、数学等重复性工作负载。如果出现明显的运行时问题,请告知;到目前为止,它似乎经受住了我施加的各种复杂工作负载。希望这次版主不会为了置顶帖而删除它,因为在那里面很容易被淹没。来源:https://github.com/UDPSendToFailed/ninfer-4090
相似文章
NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进
NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。
太棒了。令牌速度翻倍 + KV缓存现在需要低显存 - Qwen 27B
一种名为kvflash的新型KV缓存优化,可在单张RTX 3090上使Qwen 3.6-27B的生成速度翻倍并降低显存使用,同时保持准确性。
Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。
Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。
Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。