rtx-5090

标签

Cards List
#rtx-5090

最新的LM Studio更新导致MTP性能下降

Reddit r/LocalLLaMA · 2026-06-15

有用户报告称,最新的LM Studio更新(0.4.17)消除了多令牌预测的速度提升,在RTX 5090配置上恢复到之前的性能。

0 人收藏 0 人点赞
#rtx-5090

[基准测试] RTX 5090上的DFlash推测解码与KV缓存压缩 — 3.26倍加速

Reddit r/LocalLLaMA · 2026-06-08

在 RTX 5090 上对 DFlash 推测解码结合 KV 缓存压缩进行的基准测试显示,针对 Qwen3.6-27B 模型最高可实现 3.26 倍加速,且困惑度下降极小,其中 q4_0/turbo4 提供了最佳平衡。

0 人收藏 0 人点赞
#rtx-5090

@songhan_mit: SANA Streaming: 在单张5090上进行V2V

X AI KOLs Following · 2026-06-01 缓存

SANA Streaming 支持在单张NVIDIA RTX 5090 GPU上进行视频到视频生成。

0 人收藏 0 人点赞
#rtx-5090

@danyurkin: 我不再需要云模型了

X AI KOLs Following · 2026-05-20 缓存

一则推文显示,多令牌预测(MTP)在双RTX 5090硬件上为Qwen模型带来了显著的加速,表明本地推理现在可以与云模型性能媲美。

0 人收藏 0 人点赞
#rtx-5090

@populartourist: llama.cpp 发布版本 b9235 添加了一些用于提升推理性能的新工具。使用 llama.c 对 RTX 5090 上的 Qwen3.6 27B 进行了基准测试…

X AI KOLs Following · 2026-05-20 缓存

llama.cpp 发布版本 b9235 引入了推测性 n-gram 调优,在 RTX 5090 上的 Qwen3.6 27B 上实现了高达约 7 倍的吞吐量提升,其中 k4v96 配置在 10k 和 70k token 测试中表现出最佳的持续性能。

0 人收藏 0 人点赞
#rtx-5090

在 Qwen3.6 - RTX 5090 上测试 llama.cpp 的 MTP 支持

Reddit r/LocalLLaMA · 2026-05-17

在 RTX 5090 上使用 Qwen3.6 模型对 llama.cpp 的新多标记预测(MTP)支持进行技术测试,比较不同提示和 GGUF 量化下开启和关闭 MTP 的性能表现。

0 人收藏 0 人点赞
#rtx-5090

@populartourist: Unsloth Qwen3.6 27B Q6_K 在 RTX 5090 上通过 MTP 实现超过 100 令牌/秒。相比没有 MTP 时的 45-50 令牌/秒大幅提升。这真是太…

X AI KOLs Timeline · 2026-05-16 缓存

Unsloth Qwen3.6 27B Q6_K 在 RTX 5090 上通过 MTP 达到每秒超过 100 个令牌,相比没有 MTP 时的 45-50 令牌/秒显著提升。

0 人收藏 0 人点赞
#rtx-5090

RTX 5090 搭配 Qwen3.6 能否达到 > 3,000 tok/s?欢迎来拍砖(open-dllm)

Reddit r/LocalLLaMA · 2026-05-16

Open-dLLM 将 Qwen3.6 适配为使用扩散式生成,在 RTX 5090 上对于短序列实现了超过 3,000 tok/s 的吞吐量,相关代码已在 GitHub 上发布。

0 人收藏 0 人点赞
#rtx-5090

NVIDIA 据传因 GDDR7 成本上涨准备提高 RTX 5090 价格(可能也包括 RTX 50 和 PRO 系列)

Reddit r/LocalLLaMA · 2026-05-14 缓存

据传,NVIDIA 正计划因其 GDDR7 内存成本上涨而提高即将推出的 RTX 5090 显卡的价格。

0 人收藏 0 人点赞
#rtx-5090

我追踪了欧盟15家商店的GPU价格超过50天——RTX 5090是唯一没有降价的显卡

Reddit r/LocalLLaMA · 2026-05-14

追踪欧盟15家GPU商店显示,RTX 5090价格因AI/工作站需求上涨3%,而其他GPU下降7-9%,表明AI推理硬件价格将持续高位。

0 人收藏 0 人点赞
#rtx-5090

根据我的需求,购买5090值得吗?

Reddit r/LocalLLaMA · 2026-05-13

用户询问,相较于云计算的替代方案,花费约5500美元购买RTX 5090及高端PC用于LLM实验和学习是否值得。

0 人收藏 0 人点赞
#rtx-5090

Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s

Reddit r/LocalLLaMA · 2026-05-08

一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。

1 人收藏 1 人点赞
#rtx-5090

试了 Qwen3.6-27B-UD-Q6_K_XL.gguf 配 CloudeCode,真不敢相信居然能用

Reddit r/LocalLLaMA · 2026-04-22

用户报告称,在 RTX 5090 本地运行 Qwen3-27B-UD-Q6_K_XL.gguf,200K 上下文速度约 50 tok/s,编码表现出乎意料地可用,标志着本地模型质量大幅跃升。

0 人收藏 0 人点赞
#rtx-5090

@CuiMao: 你别说,你真别说,本地跑LM studio接一个Claude code,效果相当满意,5090开64k上下文,能跑200+token。

X AI KOLs Timeline · 2026-04-20 缓存

用户分享在本地使用LM Studio配合Claude Code的运行体验,称使用RTX 5090可实现64k上下文并达到每秒200+ token的生成速度,效果令人满意。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈