标签
推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。
SGLang 已更新其在 RTX 5090 和 RTX Pro 6000 硬件上部署 Qwen3.8-27B 模型的配置指南,为不同配置添加了变体,并提供了调优选项。
作者对 DeepSeek V4 0731 进行量化,修复了会导致基线偏差的 FP8 降转换问题,并在 8× RTX 5090 上对 38 个量化文件进行基准测试,展示了依赖 GPU 的结果和基于文件大小的比较。
在 RTX 5090 上对 unsloth 的 Muse Glimmer 30B 进行基准测试,采用推测解码,使用 DFlash 草稿模型和基于 GPU 的 argmax PR,最高可达 253 t/s,不过该 PR 仍是草稿状态。
一位 Reddit 用户构建了一款名为 12vhpwr-guard 的开源工具,可监控 ASUS Astral RTX 5080/5090 显卡的每针电流,如果任何针脚电流超过 9.5A 并持续 15 秒,就会关闭电脑,以防 12VHPWR 接口熔化。
关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。
Autonomous AI 开源了一款由 2x 或 4x NVIDIA RTX 5090 驱动的个人 AI 计算机构建方案,实现完全本地、私有的 AI 托管,无需 API 成本或速率限制。
Best Buy 已将 Asus ROG Astral RTX 5080 OC 的价格上调至 2,099 美元,超过了 RTX 5090 的 MSRP,反映了持续的组件短缺和 GPU 价格上涨。
一位开发者使用开源权重模型在消费级RTX 5090 GPU上创建了一个代码审查工具,在Martian代码审查基准上取得了F1 22.7的成绩,目前正在考虑将其商业化或开源。
详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。
中国工厂将消费级RTX 5090 GPU改装成128GB服务器显卡,以规避专用AI芯片的出口管制,形成了官方企业级产品的灰色市场竞争对手。
基准测试表明,在 RTX 5090 上使用 LM Studio 并行运行 4-5 个代理可最大化吞吐量,而更多代理会因显存和计算分割导致收益递减。
在 RTX 5090 上运行 Qwen3.6 27B,调整 MTP 和缓存设置后达到每秒 6.4k 个 token,展示了推理优化技术。
在RTX 5090上运行量化后的Gemma-4-31B模型,上下文长度从35k增加到80k,展示了显著的性能提升。
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
Ahmad Osman 预测,在18个月内,像 RTX 5090 这样的GPU将能够承载相当于 GLM 5.2 的智能。
Qwen 3.6 27B is a dense 27B model that achieves impressive performance on local hardware with 256k context, running at 30 tokens/s on MacBook Max M5 and 50 tokens/s on RTX 5090, and is considered by some as the first local model with true general intelligence.
关于是在本地运行AI模型还是通过API运行的详细分析,涵盖了RTX 5090、RTX PRO 6000和DGX Spark等硬件选项,重点讨论了内存与带宽的权衡、成本考虑以及隐私需求。
MSI的RTX 5090 GPU在推理或训练时功耗为475-500W,并附有关于线缆弯折的警告。