dense-models

标签

Cards List
#dense-models

我实测了:将密集27B模型换成30B-A3B MoE模型如何改变本地并发上限(与先前测试相同平台,仅改变一个变量)

Reddit r/AI_Agents · 昨天

作者在MacBook Pro上测试并比较了密集与MoE AI模型的并发性能,发现由于每个token的内存带宽使用更低,MoE模型的扩展性显著更好。

0 人收藏 0 人点赞
#dense-models

12GB显存的小伙伴们,我们的计划是什么?

Reddit r/LocalLLaMA · 2026-08-11

讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。

0 人收藏 0 人点赞
#dense-models

@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following · 2026-08-08 缓存

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

0 人收藏 0 人点赞
#dense-models

llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平

Reddit r/LocalLLaMA · 2026-07-25

对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。

0 人收藏 0 人点赞
#dense-models

为什么MoE模型如此被轻视?

Reddit r/LocalLLaMA · 2026-07-11

讨论了一种常见观点,即低活跃参数量的MoE模型不如密集模型,并认为路由器的有效性和架构细节才是关键。

0 人收藏 0 人点赞
#dense-models

将混合专家模型剪枝与蒸馏为稠密语言模型

Hugging Face Daily Papers · 2026-05-27 缓存

一个系统框架通过专家评分、选择、分组和知识蒸馏将混合专家模型转换为稠密架构,相比传统剪枝方法实现了更优的性能和效率。

0 人收藏 0 人点赞
#dense-models

除了更快之外,MoE 模型的意义何在?

Reddit r/LocalLLaMA · 2026-05-19

讨论混合专家(MoE)模型在速度之外相对于密集模型的优势,考虑内存限制和扩展限制。

0 人收藏 0 人点赞
#dense-models

内存富裕/显卡贫瘠的人错了吗?

Reddit r/LocalLLaMA · 2026-05-15

讨论了本地AI中密集模型与混合专家(MoE)模型之间的权衡,指出高内存用户除了Qwen 3.5 122B之外,MoE选择有限,并质疑大显存是否是唯一可行的路径。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈