标签
用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.
详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
据报道,一个四行修复将 DeepSeek-V4-Flash 的预填充速度从 10K 上下文下的 127 t/s 提升至 312 t/s,从 40K 上下文下的 91 t/s 提升至 283 t/s,解码速度保持不变。该补丁通过 club-3090 项目分享,该项目用于在 RTX 3090 上提供 LLM 服务。
这条推文讨论了硬件价格上涨(包括二手RTX 3090),并认为前沿智能不仅限于数据中心,从而论证了看好本地/开源AI的理由。
Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。
关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。
对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。
用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
宣布Ornith-1.0-35B,一个Qwen3.6-35B-A3B的编码微调版本,在aider基准测试上略优于基础模型。同时推广用于在RTX 3090上运行LLM的club-3090仓库。
在 RTX 3090 上运行 Qwen3.6-35B-A3B APEX 模型的详细指南:比较两个 llama.cpp 分支及量化方法,以达到最佳速度与质量。
用户报告使用 llama.cpp 在 RTX 3090 上运行 Qwen 3.6-35b-a3b MoE 模型,实现了超过 90 tokens/s 的推理速度,预填充速度超过 1000 t/s,表明在消费级硬件上本地部署大型语言模型是可行的。
讨论运行 Qwen 3.6 模型的最便宜硬件选项,比较 RTX 3090 和 Tesla V100 GPU,并详细列出约 2000 美元系统的成本构成。
使用 RTX 5080 和 RTX 3090 GPU 的配置在 Qwen 3.6 27B Q8 模型上实现了每秒 80 个令牌。
club-3090 为 Qwen3.6-27B 添加了实验性 FP8 支持,使得配备双 RTX 3090 的机器能够以与未量化 BF16 相似的性能运行该模型。
作者观察到,二手 RTX 3090 GPU 在 eBay 上的售价为 1300-1500 美元,高于五年前购买的全新 3090 Ti,并质疑为什么人们会以如此高价购买老旧二手 GPU 用于 AI 工作站。
一条推文建议用户购买RTX 3090以在本地运行AI模型,声称这简单、性能出色且便宜。