标签
在单张 RTX 5090 GPU 上使用 Qwen3.8:27b 模型,达到每秒 85.6 token 的性能。
在NVIDIA 5070 Ti GPU上对Qwen-Image-2.1的测试表明,它能在16GB显存内运行,生成1024²图像的时间约为25秒,并突出了出色的提示词遵循和排版能力。
针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。
展示了Qwen3.8-27B AI模型在12GB RTX 3080 Ti GPU上的性能,使用llama.cpp在特定量化设置下,在128K上下文中达到每秒47个令牌。
一位用户报告称,使用 Ninfer 工具在 NVIDIA RTX 5090 GPU 上运行 Qwen 3.8B 模型时,获得了高令牌吞吐量,显著优于 llama.cpp。
对 RTX 6000 GPU 上社区量化的 Qwen 3.8 27B 模型与 Claude Opus 4.6 进行基准比较,评估其在创建 HTML 游戏时的 token 生成速度和效率。
LLM4LLM引入了一个部署感知的闭环优化框架,用于桥接内核基准测试和实际LLM推理,在H100 GPU上实现了高达6.98倍的加速。
本文描述了使用8块B300 GPU托管具有2.8万亿参数的Kimi K3 AI模型,实现了每秒92个令牌,成本为每百万令牌190美元,同时与Unsloth的动态GGUF量化方法进行了比较。
UC Berkeley 已开源 FreeToken,这是一个显著加快消费级 GPU 上本地 AI 推理速度的工具,在 8GB RTX 4060 笔记本电脑上实现高达 39.3 tok/s 的性能。
一位用户在 SVG 生成任务中测试了 Qwen3.8 27B 模型,并使用了一个复杂提示,发现结果超出了预期,突显了该模型在创造性任务上的能力。
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。
本文解释了如何通过分析从HBM获取的每字节操作数来确定GPU工作负载是计算受限还是内存受限,以NVIDIA的H100为例,并讨论了批处理和提示长度如何影响性能。
一位开发者描述了让他们的AI智能体通过运行受控探测和测量性能来自主测试模型升级,揭示了限制其自身的问题。
NVIDIA推出关于AI模型协同设计(AI Model Co-Design)的系列内容,解释模型维度如何影响GPU性能,以及LLM部署中吞吐量与交互性之间的权衡。第一篇文章提供了设计硬件友好型LLM的实用入门指南,以提升系统吞吐量和用户响应速度。
用户报告称 Qwen3.6 27B NVFP4 量化版本在编码方面不可靠,尽管吞吐量高但质量不稳定,并建议 Q4_K_M 可能更稳定。
Unsloth 发布了优化后的 Qwen3.6-27B MTP 模型 GGUF 版本,与前序量化版本相比,推理速度显著提升(在 RTX 5090 上最高可达 114 tok/s)。