Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。
摘要
Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。
暂无内容
相似文章
Ninfer 和 RTX 5090 配合 3.8 27B 模型让我喜极而泣,效果太棒了。
一位用户报告称,使用 Ninfer 工具在 NVIDIA RTX 5090 GPU 上运行 Qwen 3.8B 模型时,获得了高令牌吞吐量,显著优于 llama.cpp。
NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进
NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。
(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试
一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。
NInfer RTX 4090 for Qwen 3.8 27B 更新 - 最高支持25万-35万令牌上下文在显存中
作者已更新其 NInfer 分叉,添加了 rk2v4-e8 量化选项用于 KV 缓存,使得在单张 RTX 4090 上实现最高25万-35万令牌上下文,无需溢出到系统内存,并进行了优化以提升生成速度。
Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。