moe

标签

Cards List
#moe

12GB显存的小伙伴们,我们的计划是什么?

Reddit r/LocalLLaMA · 2天前

讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。

0 人收藏 0 人点赞
#moe

我通过在10万个示例上训练一个40M连接器,为DeepSeek V4 Flash赋予了基础视觉能力

Reddit r/LocalLLaMA · 3天前

作者在10万个样本上训练了一个40M参数的连接器,使DeepSeek V4 Flash获得基础的视觉能力,同时冻结语言模型和MoonViT图像编码器,展示了将纯文本MoE转变为基础VLM的低成本方法。

0 人收藏 0 人点赞
#moe

我已将 Maple-Preview 添加到 Mference,在 Air M4 上仅用 500MB 内存实现了 40 tps 的生成速度

Reddit r/LocalLLaMA · 3天前

作者为 Mference 添加了 Maple-Preview 支持。Mference 是一款通过从磁盘流式加载 MoE 专家来在低内存设备上运行大型模型的工具,作者在 Air M4 上实现了仅用 500MB 内存达到 40 tps 的速度。

0 人收藏 0 人点赞
#moe

我在ESP32 Dev Kit V1上运行了完整的LLM模型(仅用81KB内存)

Reddit r/ArtificialInteligence · 5天前

一位开发者成功在ESP32 Dev Kit V1上运行了量化至INT4的520万参数MoE LLM,仅使用81KB SRAM,通过从闪存流式加载专家,实现了约每秒5个token的速度。

0 人收藏 0 人点赞
#moe

UniMoMo:基于专家合并的大型推荐模型MoE加速

Hugging Face Daily Papers · 5天前 缓存

UniMoMo通过基于功能行为和路由流量合并专家来压缩基于MoE的推荐模型,在加速推理的同时保持质量。

0 人收藏 0 人点赞
#moe

@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following · 5天前 缓存

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

0 人收藏 0 人点赞
#moe

@gmkurtzer:我刚听了来自@arcee_ai首席技术官@latkins的这个视频,他谈到了训练大型MO…

X AI KOLs Following · 2026-08-07 缓存

Gregory Kurtzer称赞Lucas Atkins的演讲,内容涉及训练大型稀疏混合专家模型的经验教训,以及AI实验室初创公司的生活。

0 人收藏 0 人点赞
#moe

Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Reddit r/LocalLLaMA · 2026-08-06

A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.

0 人收藏 0 人点赞
#moe

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG · 2026-08-06 缓存

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。

0 人收藏 0 人点赞
#moe

Inkling-Small 276B-A12B 在低于10GB内存下约2.9 tok/s

Reddit r/LocalLLaMA · 2026-08-05

Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。

0 人收藏 0 人点赞
#moe

jabbatheduck/DeepSeek-v4-flash-mini · Hugging Face

Reddit r/LocalLLaMA · 2026-08-05 缓存

jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。

0 人收藏 0 人点赞
#moe

Mixture-of-Kittens:我们为NVL72s提供的开源MoE巨型内核(25分钟阅读)

TLDR AI · 2026-08-05 缓存

Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。

0 人收藏 0 人点赞
#moe

deepgrove/maple-preview

Hugging Face Models Trending · 2026-08-04 缓存

DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。

0 人收藏 0 人点赞
#moe

Show HN:Maple-Preview——在 iPhone 上以 120 tok/s 运行的三值 20B MoE

Hacker News Top · 2026-08-04

Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。

0 人收藏 0 人点赞
#moe

一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s

Reddit r/LocalLLaMA · 2026-08-04

一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。

0 人收藏 0 人点赞
#moe

@AI_Whisper_X: 转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KD…

X AI KOLs Timeline · 2026-08-04 缓存

苏剑林对K3架构进行复盘,核心为KDA + MLA + Stable LatentMoE + AttnRes的组合,讲解其设计取舍、MoE稳定性改进、为何保留MLA,以及DSV4与MLA的关系。

0 人收藏 0 人点赞
#moe

在 C 语言中、于 CPU 上运行 Kimi K3(c99 和 cpu)

Reddit r/ArtificialInteligence · 2026-08-04

一个项目声称可以通过从 NVMe SSD 流式加载专家权重并使用 MXFP4 压缩,在仅有 8GB 内存的 CPU 上运行拥有 2.78T 参数的 MoE 模型 Kimi K3,以速度换取内存效率。

0 人收藏 0 人点赞
#moe

AFM3 20B 的特殊架构:指令跟随剪枝

Reddit r/LocalLLaMA · 2026-08-04

讨论了苹果的 AFM3 20B 模型架构,该架构使用指令跟随剪枝(Instruction-Following Pruning),每个提示仅激活约 20% 的 MLP 层,并将模型存储在闪存中,以实现高效的设备端推理。

0 人收藏 0 人点赞
#moe

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers · 2026-08-04 缓存

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。

0 人收藏 0 人点赞
#moe

@peony__snow:在ARC-E上提升+3.2,仅需+0.0024%的参数和+0.056%的FLOPs。Frac-Connections重新审视残差连接,通过划分隐藏状态而不是扩展它们……

X AI KOLs Timeline · 2026-08-03 缓存

Frac-Connections是一种新方法,通过划分隐藏状态而非扩展它们,将Hyper-Connections扩展到分数扩展率。与残差连接相比,它在几乎不增加计算量的情况下实现了更强的下游性能,并在高达7B的MoE语言模型上得到了验证。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈