mixture-of-experts

标签

Cards List
#mixture-of-experts

KITE:用于高效智能体LLM扩展的KV不变Transformer扩展方法

arXiv cs.LG · 10小时前 缓存

本文介绍KITE,一种KV不变Transformer扩展方法,通过降低推理成本在保持性能的同时高效扩展LLM。它提出了SST模型,与基线相比,实现了更低的训练损失和减少的推理成本。

0 人收藏 0 人点赞
#mixture-of-experts

Qwen3.8-Omni: 迈向原生全模态智能体

arXiv cs.CL · 昨天 缓存

Qwen3.8-Omni-Flash是一款原生多模态智能体模型,旨在提升真实世界生产力。它通过MoE架构和扩展上下文窗口增强了多模态理解与推理能力,并发布了多模态应用的开源框架。

0 人收藏 0 人点赞
#mixture-of-experts

Hunyuan-A13B 技术报告

Hugging Face Daily Papers · 昨天 缓存

Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。

0 人收藏 0 人点赞
#mixture-of-experts

将大规模MoE训练保持在固定GPU内存内(20分钟阅读)

TLDR AI · 昨天 缓存

本文介绍了限制大规模MoE训练中四个关键内存峰值的方法,使得在1M上下文长度下使用固定GPU内存进行训练成为可能,并且相比基线,吞吐量提升高达10.4倍。

0 人收藏 0 人点赞
#mixture-of-experts

@AdinaYakup: RedNote 发布不频繁,但每个都很扎实 https://huggingface.co/dots-studio/dots3-note-prev…

X AI KOLs Timeline · 2天前 缓存

dots3-note Preview 是一个多模态 Mixture-of-Experts AI模型,具有280B总参数和16B激活参数,支持多达512K token上下文,在Hugging Face上作为开源权重模型发布。

0 人收藏 0 人点赞
#mixture-of-experts

通过跨层共享神经专家提升Transformer的参数利用率

arXiv cs.LG · 2天前 缓存

本文提出CS-MoE,一种创新的Transformer架构,通过跨层共享神经专家来提高参数利用率,仅激活55%的参数即可实现更低的困惑度。

0 人收藏 0 人点赞
#mixture-of-experts

推测的限制:在混合专家模型中界定推测解码

arXiv cs.LG · 2天前 缓存

本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。

0 人收藏 0 人点赞
#mixture-of-experts

@AdinaYakup:小米 @XiaomiMiMo 刚刚发布了2款顶尖模型,其中一个可能是目前最强的开源模型🔥 两者均采用:- 稀疏混合专家架构 + 100万上下文 + MIT许可协议…

X AI KOLs Timeline · 2天前 缓存

小米发布了两款顶尖AI模型:MiMo-V2.6 Pro RL(最大化能力)和MiMo-V2.6 Flash RL(最大化效率)。两者均采用稀疏混合专家架构,支持100万上下文长度,采用MIT许可协议,并原生支持文本、图像、视频和音频的全模态处理。

0 人收藏 0 人点赞
#mixture-of-experts

OneBid: 面向多样化oCPX广告场景的统一自动竞价基础模型

arXiv cs.LG · 3天前 缓存

OneBid是一个统一自动竞价基础模型,通过采用Mixture-of-Experts架构和CROP优化,解决了多样化oCPX广告场景中的挑战,在快手部署后显示了显著改进,如ROAS提升13.1%。

0 人收藏 0 人点赞
#mixture-of-experts

IntBMoE: 在专家组合中集成区块级条件的全参与式混合专家模型

arXiv cs.LG · 3天前 缓存

IntBMoE是一种新颖的混合专家方法,通过区块级条件和稀疏执行,解耦参与、执行和具体化成本,在图像分类、语言建模和推荐系统方面展现出改进,并在AMap的生成式推荐系统中实现了实际部署。

0 人收藏 0 人点赞
#mixture-of-experts

通过L0正则化混合专家模型加速稠密LLMs

arXiv cs.AI · 3天前 缓存

本文提出L0-MoE,一种使用L0正则化的轻量级混合专家模型方法,用于加速稠密LLMs,最高可实现2.5倍加速,同时保持竞争力的性能。

0 人收藏 0 人点赞
#mixture-of-experts

Attention-Aware Routing: Coupling Routing and Attention in MoEs

arXiv cs.AI · 3天前 缓存

本文提出 Attention-Aware Routing(AAR)方法,通过将注意力权重集成到路由器中来增强混合专家模型,显著提升数学推理性能,并揭示了路由与注意力之间存在的耦合动力学。

0 人收藏 0 人点赞
#mixture-of-experts

一体化多语言场景文本识别:基于脚本感知的混合专家模型

Hugging Face Daily Papers · 3天前 缓存

本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。

0 人收藏 0 人点赞
#mixture-of-experts

@yibie: https://x.com/yibie/status/2101491585741394047

X AI KOLs Timeline · 4天前 缓存

本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。

0 人收藏 0 人点赞
#mixture-of-experts

@_avichawla: https://x.com/_avichawla/status/2100876555409039605

X AI KOLs Timeline · 6天前 缓存

这篇文章解释了Mixture-of-Experts (MoE) 推理的工程方面,详细介绍了令牌路由、专家批处理、GPU分配和性能权衡,以实现高效的服务。

0 人收藏 0 人点赞
#mixture-of-experts

Flyweight:开源 C++/CUDA 引擎,可在单个 GPU 和系统 RAM 上运行超出 VRAM 大小的 MoE 模型。首次 PyPI 发布,寻求贡献者。

Reddit r/LocalLLaMA · 6天前

Flyweight 是一款开源 C++/CUDA 推理引擎,可在消费级 GPU 结合系统 RAM 的情况下运行大型 MoE 模型,提供优化性能,并与 Qwen 和 DeepSeek 等模型兼容。

0 人收藏 0 人点赞
#mixture-of-experts

llama.cpp 专家池分支:针对 Qwen 3.8 Flash next IQ4 + 16Gb 显存在 MI50 gfx906 上带参数测试

Reddit r/LocalLLaMA · 6天前 缓存

llama.cpp 的一个非官方分支为混合专家模型引入了持久化的专家池,优化以减少在 16GB AMD gfx906 GPU 上通过 PCIe 的专家重新拷贝,从而提升大上下文长度的解码吞吐量。

0 人收藏 0 人点赞
#mixture-of-experts

OceanMoE:面向长期多变量海洋预报的结构化条件稀疏计算

arXiv cs.LG · 6天前 缓存

OceanMoE 引入一种混合专家框架,结合结构化条件稀疏计算,以平衡共享海洋上下文与自适应特化,用于多变量海洋预报,展示了长期预测中提升的准确性。

0 人收藏 0 人点赞
#mixture-of-experts

无限参数LLMs:从实时数据生成与调整权重

Hacker News Top · 6天前 缓存

本文提出一种无限参数LLM架构,该架构使用超网络通过贝叶斯更新从实时数据生成权重,实现持续适应并超越上下文学习。

0 人收藏 0 人点赞
#mixture-of-experts

内存墙的另一半:使用训练路由预测从SSD服务35B MoE模型

arXiv cs.AI · 2026-09-17 缓存

Edge0是一个流式MoE推理引擎,它使用训练路由预测从SSD服务35B混合专家模型,在消费级硬件上实现接近fp16的性能,且内存使用率低。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈