@ItsmeAjayKV:过去7天我在家庭实验室运行的本地LLM分析。MoE模型现在统治了我的3090。使用最多的模型:@thinkymachine…
摘要
一位用户分享了在家庭实验室运行本地LLM的7天统计数据,指出MoE模型主导了其RTX 3090,其中Inkling-small和Ling-3.0-flash表现出色,并计划开源其仪表盘。
查看缓存全文
缓存时间: 2026/08/09 15:19
最近 7 天我在家庭实验室里跑的本地 LLM 分析结果如下。
MoE 模型现在统治了我的 3090。
使用最多的模型: @thinkymachines 的 Inkling-small-UD-Q4_K_M @AntLingAGI 的 Ling-3.0-flash Q4 已升至第二位 @deepseek_ai 的 DSV4-flash-0731 位列第三
话虽如此,有几次会话我忘记记录了,但这基本不会改变结果,因为那些会话用的都是 Inkling-small。
根据我的测试,Inkling-small 是一款非常靠谱的模型,但 Ling-3.0 正慢慢成为我的最爱,它在速度和品质之间取得了很好的平衡。
DSV4-flash 是不错,但慢到实用性不足,我讨厌等待。
天哪,我的仪表盘看起来太棒了! 不久后我就会把它开源。
相似文章
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
@TheAhmadOsman:你可以在家运行本地模型,并使用任何代理框架,如 Codex 或 Claude Code
Ahmad 构建了一个简单的工具,使 Claude Code 能与任何本地 LLM 配合使用,演示时使用了 vLLM 在 4 块 RTX 3090 上服务 GLM-4.5 Air。
@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…
本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。
@ItsmeAjayKV: 3090 更新:现在使用 Qwen 3.6-35b-a3b MoE (q6_k_xl)。首次突破 90 t/s,尚未启用 MTP,预填充速度…
用户报告使用 llama.cpp 在 RTX 3090 上运行 Qwen 3.6-35b-a3b MoE 模型,实现了超过 90 tokens/s 的推理速度,预填充速度超过 1000 t/s,表明在消费级硬件上本地部署大型语言模型是可行的。
@TheAhmadOsman: 本地AI现在很好了
Ahmad宣布了一个本地AI硬件竞技场,使用ODS在RTX PRO 6000、DGX Spark、Strix Halo、M5 MacBook Pro和ChatGPT等硬件上对LLM进行基准测试,并邀请社区为未来的比较提供意见。