moe-architecture

标签

Cards List
#moe-architecture

Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。

Reddit r/LocalLLaMA · 2天前

一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。

0 人收藏 0 人点赞
#moe-architecture

三元(1.58位)大语言模型正在卷土重来吗?

Reddit r/LocalLLaMA · 6天前

近期来自小型实验室的三元1.58位大语言模型发布展示了速度和医疗专业性,但在长期任务上表现不佳,乐观地认为未来模型能与像Qwen这样的大型架构竞争。

0 人收藏 0 人点赞
#moe-architecture

@qingke_ai: https://x.com/qingke_ai/status/2079035914740019638

X AI KOLs Timeline · 2026-07-20 缓存

本文以NVIDIA的Nemotron 3 Super和Moonshot AI的Kimi K3为例,分析了LatentMoE架构如何通过压缩Expert计算维度来解决传统MoE的效率瓶颈,并指出这是下一代MoE架构的转折点。

0 人收藏 0 人点赞
#moe-architecture

Qwen3.6-35B-A3B作为子智能体与单独使用时失败模式的差异

Reddit r/LocalLLaMA · 2026-05-27

文章讨论了Qwen3.6-35B-A3B模型在编排器下作为子智能体使用时,与单独使用相比如何表现出不同的失败模式,特别是由于其MoE架构和缺少验证层,导致错误未被检测到。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈