rtx-3090

标签

Cards List
#rtx-3090

Muse Glimmer 居然真的能装进单张 RTX 3090

Reddit r/LocalLLaMA · 18小时前

用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。

0 人收藏 0 人点赞
#rtx-3090

双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。

Reddit r/LocalLLaMA · 4天前

使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。

0 人收藏 0 人点赞
#rtx-3090

Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Reddit r/LocalLLaMA · 4天前

A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.

0 人收藏 0 人点赞
#rtx-3090

最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s

Reddit r/LocalLLaMA · 4天前

详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。

0 人收藏 0 人点赞
#rtx-3090

@no_stp_on_snek: 非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。

X AI KOLs Following · 2026-08-03 缓存

一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。

0 人收藏 0 人点赞
#rtx-3090

@malikwas1f:四行修复让 DeepSeek-V4-Flash 的预填充速度在 10K 下从 127 提升至 312 t/s,在 40K 下从 91 提升至 283 t/s,并通过了召回率检查……

X AI KOLs Timeline · 2026-08-03 缓存

据报道,一个四行修复将 DeepSeek-V4-Flash 的预填充速度从 10K 上下文下的 127 t/s 提升至 312 t/s,从 40K 上下文下的 91 t/s 提升至 283 t/s,解码速度保持不变。该补丁通过 club-3090 项目分享,该项目用于在 RTX 3090 上提供 LLM 服务。

0 人收藏 0 人点赞
#rtx-3090

@TheAhmadOsman: 放下一切——为何硬件价格(包括2020年的二手RTX 3090)越来越贵——无论前沿……

X AI KOLs Timeline · 2026-07-21 缓存

这条推文讨论了硬件价格上涨(包括二手RTX 3090),并认为前沿智能不仅限于数据中心,从而论证了看好本地/开源AI的理由。

0 人收藏 0 人点赞
#rtx-3090

@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF

X AI KOLs Following · 2026-07-16 缓存

Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。

0 人收藏 0 人点赞
#rtx-3090

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 在双RTX 3090上

Reddit r/LocalLLaMA · 2026-07-16

关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。

0 人收藏 0 人点赞
#rtx-3090

@superalesha: 别急着埋葬RTX 3090,先读完这个!@UnslothAI本周发布了qwen3.6-35b的两个新4位量化版本。我花了…

X AI KOLs Timeline · 2026-07-11 缓存

对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。

0 人收藏 0 人点赞
#rtx-3090

RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith

Reddit r/LocalLLaMA · 2026-07-02

用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。

0 人收藏 0 人点赞
#rtx-3090

Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS

Reddit r/LocalLLaMA · 2026-06-30

一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。

0 人收藏 0 人点赞
#rtx-3090

@malikwas1f: Ornith-1.0-35B:一个Qwen3.6-35B-A3B的编码微调版本,在真实编码上略优于基础模型(aider 15/30 vs 13)——完整262K…

X AI KOLs Timeline · 2026-06-26 缓存

宣布Ornith-1.0-35B,一个Qwen3.6-35B-A3B的编码微调版本,在aider基准测试上略优于基础模型。同时推广用于在RTX 3090上运行LLM的club-3090仓库。

0 人收藏 0 人点赞
#rtx-3090

Qwen3.6-35B-A3B APEX 在单张 RTX 3090 上——充分发挥其潜力

Reddit r/LocalLLaMA · 2026-06-22

在 RTX 3090 上运行 Qwen3.6-35B-A3B APEX 模型的详细指南:比较两个 llama.cpp 分支及量化方法,以达到最佳速度与质量。

0 人收藏 0 人点赞
#rtx-3090

@ItsmeAjayKV: 3090 更新:现在使用 Qwen 3.6-35b-a3b MoE (q6_k_xl)。首次突破 90 t/s,尚未启用 MTP,预填充速度…

X AI KOLs Timeline · 2026-06-17 缓存

用户报告使用 llama.cpp 在 RTX 3090 上运行 Qwen 3.6-35b-a3b MoE 模型,实现了超过 90 tokens/s 的推理速度,预填充速度超过 1000 t/s,表明在消费级硬件上本地部署大型语言模型是可行的。

0 人收藏 0 人点赞
#rtx-3090

Qwen 3.6 最便宜的硬件:27B 和 35B-A3B 版本

Reddit r/LocalLLaMA · 2026-06-15

讨论运行 Qwen 3.6 模型的最便宜硬件选项,比较 RTX 3090 和 Tesla V100 GPU,并详细列出约 2000 美元系统的成本构成。

0 人收藏 0 人点赞
#rtx-3090

RTX 5080 和 RTX 3090 配置:在 Qwen 3.6 27B Q8 上达到 80 令牌/秒

Hacker News Top · 2026-06-13

使用 RTX 5080 和 RTX 3090 GPU 的配置在 Qwen 3.6 27B Q8 模型上实现了每秒 80 个令牌。

0 人收藏 0 人点赞
#rtx-3090

club-3090 为 Qwen3.6-27B 添加实验性 FP8 支持!

Reddit r/LocalLLaMA · 2026-06-07

club-3090 为 Qwen3.6-27B 添加了实验性 FP8 支持,使得配备双 RTX 3090 的机器能够以与未量化 BF16 相似的性能运行该模型。

0 人收藏 0 人点赞
#rtx-3090

RTX 3090 在 eBay 上的价格太疯狂了!!

Reddit r/LocalLLaMA · 2026-06-06

作者观察到,二手 RTX 3090 GPU 在 eBay 上的售价为 1300-1500 美元,高于五年前购买的全新 3090 Ti,并质疑为什么人们会以如此高价购买老旧二手 GPU 用于 AI 工作站。

0 人收藏 0 人点赞
#rtx-3090

@TheAhmadOsman: 你应该购买RTX 3090并学习如何在本地运行模型。精英们不想让你知道,但运行本地模型…

X AI KOLs Following · 2026-05-24 缓存

一条推文建议用户购买RTX 3090以在本地运行AI模型,声称这简单、性能出色且便宜。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈