moe-model

标签

Cards List
#moe-model

在16GB显存+32GB内存下运行Qwen 3.8 - 写给贫民窟GPU玩家的实用/趣味指南

Reddit r/LocalLLaMA · 2天前

一位Reddit用户分享了如何在拥有16GB显存和32GB内存的系统上,通过激进量化及特定llama.cpp设置成功运行Qwen 3.8 Next MoE模型,实现了在有限硬件上高效运行大模型的效果。

0 人收藏 0 人点赞
#moe-model

DeepSeek V4.1 Flash 正在令人惊讶地接近 GPT-5.6 Sol 的领域,同时价格低得离谱

Reddit r/singularity · 6天前

DeepSeek 发布了 V4.1 Flash,一个 552B MoE 模型,具有高效的活动参数,性能接近 GPT-5.6 Sol,而成本却低得多。

0 人收藏 0 人点赞
#moe-model

DeepSeek-V4-Flash-Vision-Exp (285B MoE) 在 10-12 张 RTX 3090 上 — 推测解码,视觉

Reddit r/LocalLLaMA · 2026-09-09

在 10-12 张 RTX 3090 GPU 上运行 DeepSeek-V4-Flash-Vision-Exp 285B MoE 模型,可实现超过 60-120 tok/s 的解码速度,支持视觉和工具调用,文档完整,便于重现。

0 人收藏 0 人点赞
#moe-model

@AlmustyFX: 这才是真正重要的本地AI测试。一个7.9B MoE模型在M4 Pro上以152 tok/s运行,配备64GB统一内存…

X AI KOLs Timeline · 2026-08-29 缓存

一个7.9B MoE模型在M4 Pro上以每秒152个令牌的速度运行,配备64GB统一内存,能够离线处理敏感合同数据,并展示了本地AI的实际应用。

0 人收藏 0 人点赞
#moe-model

今日在双DGX Spark上运行Qwen3.8-Flash-Next时聚合吞吐量达到181 tok/s

Reddit r/LocalLLaMA · 2026-08-28

使用2台DGX Spark集群,通过NVMe映射和推测解码等优化,在Qwen3.8-Flash-Next模型上实现了181令牌每秒的聚合吞吐量。

0 人收藏 0 人点赞
#moe-model

llama.cpp 在混合专家模型(MoE)和 GPU+CPU 卸载场景下,P 核比 E 核更慢?

Reddit r/LocalLLaMA · 2026-07-24

观察到在使用 GPU+CPU 卸载运行混合专家模型时,llama.cpp 在 P 核上的运行速度比 E 核慢。

0 人收藏 0 人点赞
#moe-model

Qwen3.5 122B 是最好的吗?

Reddit r/LocalLLaMA · 2026-07-09

一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。

0 人收藏 0 人点赞
#moe-model

@sudoingX: 那些用16GB显卡的,别再滑了。@pupposandro 和 @davideciffa 把 qwen 35b-a3b 压缩到13.3GB,在……上实测

X AI KOLs Timeline · 2026-06-10 缓存

一种名为 luce spark 的技术让 Qwen 35B-a3B MoE 模型能够在16GB GPU(如RTX 3090)上运行,通过学习哪些专家被频繁使用,并将其余专家从内存流式加载,实现约100 tok/s,且不受显存瓶颈限制。

0 人收藏 0 人点赞
#moe-model

Llama.cpp B9406 MTP mmproj 修复

Reddit r/LocalLLaMA · 2026-05-29

Llama.cpp 版本 B9406 修复了在使用 MTP 和 MoE 视觉模型(例如 Qwen3.6-35B-A3B)时出现的崩溃问题 (GGML_ASSERT)。

0 人收藏 0 人点赞
#moe-model

回复:Cohere的Command-A系列模型后来怎么样了?

Reddit r/LocalLLaMA · 2026-05-20

Cohere发布Command A+,其首个混合专家模型,采用Apache 2.0许可,具备高效量化,可在1-2块GPU上部署,优先考虑实用性和对开发者的开放访问。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈