gpu-performance

标签

Cards List
#gpu-performance

单张 RTX 5090 运行 Qwen3.8:27b 实现 85.6 token/s MTP

Reddit r/LocalLLaMA ↗ · 昨天

在单张 RTX 5090 GPU 上使用 Qwen3.8:27b 模型,达到每秒 85.6 token 的性能。

0 人收藏 0 人点赞
#gpu-performance

@BenjaminDEKR: 这里是我对NVIDIA 5070 Ti GPU(16GB显存)上Qwen-Image-2.1的测试结果 它能运行,并且相当快。大约25秒生成1024²图像…

X AI KOLs Timeline ↗ · 2026-09-20 缓存

在NVIDIA 5070 Ti GPU上对Qwen-Image-2.1的测试表明,它能在16GB显存内运行,生成1024²图像的时间约为25秒,并突出了出色的提示词遵循和排版能力。

0 人收藏 0 人点赞
#gpu-performance

这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越

Reddit r/LocalLLaMA ↗ · 2026-09-12

针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。

0 人收藏 0 人点赞
#gpu-performance

@superalesha: 你们大多数人可能不知道一个8.4GB的模型在12GB RTX 3080 Ti上能做什么。Qwen3.8-27B制作了这个体素日本宝塔花园……

X AI KOLs Timeline ↗ · 2026-09-02 缓存

展示了Qwen3.8-27B AI模型在12GB RTX 3080 Ti GPU上的性能,使用llama.cpp在特定量化设置下,在128K上下文中达到每秒47个令牌。

0 人收藏 0 人点赞
#gpu-performance

Ninfer 和 RTX 5090 配合 3.8 27B 模型让我喜极而泣,效果太棒了。

Reddit r/LocalLLaMA ↗ · 2026-08-28

一位用户报告称,使用 Ninfer 工具在 NVIDIA RTX 5090 GPU 上运行 Qwen 3.8B 模型时,获得了高令牌吞吐量,显著优于 llama.cpp。

0 人收藏 0 人点赞
#gpu-performance

在 RTX 6000 上对比社区量化 Qwen 3.8 27B 与 Claude Opus 4.6

Reddit r/LocalLLaMA ↗ · 2026-08-26

对 RTX 6000 GPU 上社区量化的 Qwen 3.8 27B 模型与 Claude Opus 4.6 进行基准比较,评估其在创建 HTML 游戏时的 token 生成速度和效率。

0 人收藏 0 人点赞
#gpu-performance

LLM4LLM:通过闭环智能体优化桥接内核基准测试与实际部署

arXiv cs.AI ↗ · 2026-08-25 缓存

LLM4LLM引入了一个部署感知的闭环优化框架,用于桥接内核基准测试和实际LLM推理,在H100 GPU上实现了高达6.98倍的加速。

0 人收藏 0 人点赞
#gpu-performance

我使用8块B300部署了Kimi K3(2.8T参数)。速率92令牌/秒,每百万令牌190美元

Reddit r/LocalLLaMA ↗ · 2026-08-23

本文描述了使用8块B300 GPU托管具有2.8万亿参数的Kimi K3 AI模型,实现了每秒92个令牌,成本为每百万令牌190美元,同时与Unsloth的动态GGUF量化方法进行了比较。

0 人收藏 0 人点赞
#gpu-performance

@Yuchenj_UW: UC Berkeley 开源了 FreeToken。惊人结果:单个 RTX PRO 6000 以 14.9 tok/s 运行 753B GLM-5.2!8GB RTX...

X AI KOLs Following ↗ · 2026-08-21 缓存

UC Berkeley 已开源 FreeToken,这是一个显著加快消费级 GPU 上本地 AI 推理速度的工具,在 8GB RTX 4060 笔记本电脑上实现高达 39.3 tok/s 的性能。

0 人收藏 0 人点赞
#gpu-performance

Qwen3.8 27B 在 SVG 生成上超出了我的预期 :D

Reddit r/LocalLLaMA ↗ · 2026-08-20

一位用户在 SVG 生成任务中测试了 Qwen3.8 27B 模型,并使用了一个复杂提示,发现结果超出了预期,突显了该模型在创造性任务上的能力。

0 人收藏 0 人点赞
#gpu-performance

我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps

Reddit r/LocalLLaMA ↗ · 2026-08-17

作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。

0 人收藏 0 人点赞
#gpu-performance

@akshay_pachaar: 如何判断你的GPU是计算受限还是内存受限?这里有一个简单的解释:你的模型权重位于……

X AI KOLs Following ↗ · 2026-08-16 缓存

本文解释了如何通过分析从HBM获取的每字节操作数来确定GPU工作负载是计算受限还是内存受限,以NVIDIA的H100为例,并讨论了批处理和提示长度如何影响性能。

0 人收藏 0 人点赞
#gpu-performance

我让智能体自己测试模型升级,而不是相信更新日志。它发现了3个限制自己的问题

Reddit r/AI_Agents ↗ · 2026-08-15

一位开发者描述了让他们的AI智能体通过运行受控探测和测量性能来自主测试模型升级,揭示了限制其自身的问题。

0 人收藏 0 人点赞
#gpu-performance

@NVIDIAAI: 随着AI模型在规模和能力上不断增长,塑造模型与其大小同等重要。我们正在推出…

X AI KOLs Timeline ↗ · 2026-07-13 缓存

NVIDIA推出关于AI模型协同设计(AI Model Co-Design)的系列内容,解释模型维度如何影响GPU性能,以及LLM部署中吞吐量与交互性之间的权衡。第一篇文章提供了设计硬件友好型LLM的实用入门指南,以提升系统吞吐量和用户响应速度。

0 人收藏 0 人点赞
#gpu-performance

@populartourist: 在仓库上持续使用 Qwen3.6 27B NVFP4 后,很明显这个量化版本并不可靠,至少在编…

X AI KOLs Timeline ↗ · 2026-06-15 缓存

用户报告称 Qwen3.6 27B NVFP4 量化版本在编码方面不可靠,尽管吞吐量高但质量不稳定,并建议 Q4_K_M 可能更稳定。

0 人收藏 0 人点赞
#gpu-performance

@TeksEdge: Unsloth 发布了目前我测试过的最快的 Qwen3.6-27B MTP GGUF。是时候升级了。与之前的 GGUF 相比,Q4/Q6 XL 版本的推理速度快了约 55%…

X AI KOLs Timeline ↗ · 2026-05-12

Unsloth 发布了优化后的 Qwen3.6-27B MTP 模型 GGUF 版本,与前序量化版本相比,推理速度显著提升(在 RTX 5090 上最高可达 114 tok/s)。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈