moe

标签

Cards List
#moe

我在ESP32 Dev Kit V1上运行了完整的LLM模型(仅用81KB内存)

Reddit r/ArtificialInteligence · 17小时前

一位开发者成功在ESP32 Dev Kit V1上运行了量化至INT4的520万参数MoE LLM,仅使用81KB SRAM,通过从闪存流式加载专家,实现了约每秒5个token的速度。

0 人收藏 0 人点赞
#moe

@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following · 昨天 缓存

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

0 人收藏 0 人点赞
#moe

@gmkurtzer:我刚听了来自@arcee_ai首席技术官@latkins的这个视频,他谈到了训练大型MO…

X AI KOLs Following · 2天前 缓存

Gregory Kurtzer称赞Lucas Atkins的演讲,内容涉及训练大型稀疏混合专家模型的经验教训,以及AI实验室初创公司的生活。

0 人收藏 0 人点赞
#moe

Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Reddit r/LocalLLaMA · 3天前

A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.

0 人收藏 0 人点赞
#moe

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG · 3天前 缓存

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。

0 人收藏 0 人点赞
#moe

Inkling-Small 276B-A12B 在低于10GB内存下约2.9 tok/s

Reddit r/LocalLLaMA · 4天前

Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。

0 人收藏 0 人点赞
#moe

jabbatheduck/DeepSeek-v4-flash-mini · Hugging Face

Reddit r/LocalLLaMA · 4天前 缓存

jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。

0 人收藏 0 人点赞
#moe

Mixture-of-Kittens:我们为NVL72s提供的开源MoE巨型内核(25分钟阅读)

TLDR AI · 4天前 缓存

Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。

0 人收藏 0 人点赞
#moe

deepgrove/maple-preview

Hugging Face Models Trending · 5天前 缓存

DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。

0 人收藏 0 人点赞
#moe

Show HN:Maple-Preview——在 iPhone 上以 120 tok/s 运行的三值 20B MoE

Hacker News Top · 5天前

Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。

0 人收藏 0 人点赞
#moe

一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s

Reddit r/LocalLLaMA · 5天前

一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。

0 人收藏 0 人点赞
#moe

@AI_Whisper_X: 转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KD…

X AI KOLs Timeline · 5天前 缓存

苏剑林对K3架构进行复盘,核心为KDA + MLA + Stable LatentMoE + AttnRes的组合,讲解其设计取舍、MoE稳定性改进、为何保留MLA,以及DSV4与MLA的关系。

0 人收藏 0 人点赞
#moe

在 C 语言中、于 CPU 上运行 Kimi K3(c99 和 cpu)

Reddit r/ArtificialInteligence · 5天前

一个项目声称可以通过从 NVMe SSD 流式加载专家权重并使用 MXFP4 压缩,在仅有 8GB 内存的 CPU 上运行拥有 2.78T 参数的 MoE 模型 Kimi K3,以速度换取内存效率。

0 人收藏 0 人点赞
#moe

AFM3 20B 的特殊架构:指令跟随剪枝

Reddit r/LocalLLaMA · 5天前

讨论了苹果的 AFM3 20B 模型架构,该架构使用指令跟随剪枝(Instruction-Following Pruning),每个提示仅激活约 20% 的 MLP 层,并将模型存储在闪存中,以实现高效的设备端推理。

0 人收藏 0 人点赞
#moe

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers · 5天前 缓存

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。

0 人收藏 0 人点赞
#moe

@peony__snow:在ARC-E上提升+3.2,仅需+0.0024%的参数和+0.056%的FLOPs。Frac-Connections重新审视残差连接,通过划分隐藏状态而不是扩展它们……

X AI KOLs Timeline · 6天前 缓存

Frac-Connections是一种新方法,通过划分隐藏状态而非扩展它们,将Hyper-Connections扩展到分数扩展率。与残差连接相比,它在几乎不增加计算量的情况下实现了更强的下游性能,并在高达7B的MoE语言模型上得到了验证。

0 人收藏 0 人点赞
#moe

@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……

X AI KOLs Following · 6天前 缓存

DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。

0 人收藏 0 人点赞
#moe

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA · 2026-08-02

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。

0 人收藏 0 人点赞
#moe

有人测试过 IQ1_M 342GB 剪枝版 Kimi K3 吗?能用吗?

Reddit r/LocalLLaMA · 2026-07-30 缓存

这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。

0 人收藏 0 人点赞
#moe

FedWeave: 重新思考异构联邦MoE-LoRA中专精化的单元

arXiv cs.LG · 2026-07-30 缓存

FedWeave针对联邦MoE-LoRA提出非对称聚合方法,通过分离专家聚合与路由器优化来处理任务异构性,从而实现更好的专精化与性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈