EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由
摘要
EntropyMoE 为无分词器大语言模型引入了一种熵感知的专家混合架构,使用动态字节补丁作为路由单元,以实现稀疏条件计算。实验表明,在保持下游精度的同时,它在基线中取得了最低的留出法每字节比特数(bits-per-byte)。
arXiv:2608.06398v1 公告类型:新
摘要:最近的字节级大语言模型(LLM)通过将字节分组为动态大小的补丁,使得无分词器建模越来越具有竞争力。然而,现有的字节补丁架构仍然对每个补丁应用相同的密集前馈计算。这种统一的计算无法根据补丁语义和粒度的变化调整模型容量。我们通过 EntropyMoE 解决了这一局限,这是一种专为动态字节补丁设计的专家混合(MoE)架构。EntropyMoE 将全局补丁 Transformer 中的密集前馈模块替换为 Top-K 专家层。每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定了其在负载核算中的贡献。路由器直接从补丁熵中选择专家,利用与动态补丁构建相同的粒度信号来组织稀疏计算。补丁熵和长度共同定义了调节专家特化的特征空间。实验表明,EntropyMoE 在匹配的密集和稀疏基线中取得了最低的留出法每字节比特数,同时保持相当的下游精度。这些结果确立了补丁熵作为稀疏条件计算的有效路由坐标,并将专家混合建模扩展到基于分词器的表示之外。
查看缓存全文
缓存时间: 2026/08/10 07:57
# EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由 ###### 摘要 近年来,字节级大语言模型(LLM)通过将字节分组为动态大小的补丁(patch),使无分词器建模的竞争力日益增强。然而,现有的字节补丁架构仍然对每个补丁应用相同的密集前馈计算。这种统一计算无法使模型容量适应补丁语义和粒度的变化。我们通过 EntropyMoE 来解决这一局限,它是一种专为动态字节补丁设计的混合专家(MoE)架构。EntropyMoE 将全局补丁 Transformer 中的密集前馈模块替换为 Top-K 专家层。每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定其对工作负载计算的贡献。路由器直接根据补丁熵选择专家,利用与动态补丁构建相同的粒度信号来组织稀疏计算。补丁熵和长度共同定义了调节专家专业化的特征空间。实验表明,EntropyMoE 在匹配的密集和稀疏基线中取得了最低的保留集每字节比特数(BPB),同时保持相当的下游准确率。这些结果确立了补丁熵作为稀疏条件计算的有效路由坐标,并将混合专家建模扩展到基于分词器的表示之外。 ## 引言 现代大语言模型(LLM)通常依赖分词化作为原始文本与神经计算之间的接口。分词器将字节或字符流映射为离散子词单元(Sennrich 等 2016 (https://arxiv.org/html/2608.06398#bib.bib54); Kudo 和 Richardson 2018 (https://arxiv.org/html/2608.06398#bib.bib52)),自回归 Transformer 处理这些单元以预测下一个词元(Vaswani 等 2017 (https://arxiv.org/html/2608.06398#bib.bib13))。尽管有效,固定词表单元并不一定与字节覆盖范围、预测不确定性或建模难度对齐。后缀、标识符、多语言字节序列以及语法上重要的符号可能被分割成跨度与不确定性差异很大的单元(Xue 等 2022 (https://arxiv.org/html/2608.06398#bib.bib26); Pagnoni 等 2024 (https://arxiv.org/html/2608.06398#bib.bib31))。分词器质量也因语言和领域而异,影响下游性能(Rust 等 2021 (https://arxiv.org/html/2608.06398#bib.bib53))。这些局限性促使人们寻找暴露固定子词词元之下结构的接口。 无分词器 LLM 通过直接对字节进行操作来解决这一局限性(Xue 等 2022 (https://arxiv.org/html/2608.06398#bib.bib26); Yu 等 2023 (https://arxiv.org/html/2608.06398#bib.bib28); Wang 等 2024 (https://arxiv.org/html/2608.06398#bib.bib30))。特别是,字节潜变量 Transformer(BLT)通过将字节分组为动态大小的补丁,并在补丁级执行最昂贵的计算,使字节级建模变得实用(Pagnoni 等 2024 (https://arxiv.org/html/2608.06398#bib.bib31))。BLT 根据下一个字节的熵确定补丁边界:可预测区域用较长的补丁表示,而不确定区域则被分割为较短的补丁。因此,熵控制补丁粒度的同时,也提供了局部预测不确定性的显式度量。然而,一旦补丁形成,全局补丁 Transformer 仍对每个补丁应用相同的密集前馈变换。该架构使分段适应局部不确定性,但并未利用该信号来组织补丁级参数激活。 混合专家(MoE)模型为条件计算提供了一种自然机制(Shazeer 等 2017 (https://arxiv.org/html/2608.06398#bib.bib33); Lepikhin 等 2021 (https://arxiv.org/html/2608.06398#bib.bib34); Fedus 等 2022 (https://arxiv.org/html/2608.06398#bib.bib35))。通过对每个输入单元仅激活一小部分专家,MoE 架构在限制每个输入所用参数的同时增加了总参数容量。然而,现有 MoE LLM 主要仍是词元原生的:它们对分词器派生的词元进行路由,通常通过将高维隐藏状态投影为专家 logits 来实现(Fedus 等 2022 (https://arxiv.org/html/2608.06398#bib.bib35); Jiang 等 2024 (https://arxiv.org/html/2608.06398#bib.bib38); Dai 等 2024 (https://arxiv.org/html/2608.06398#bib.bib39))。这种表述没有考虑到路由单元是可变长度字节补丁且不确定性信号已由补丁化流程计算出来的情况。它也没有回答:当模型已经暴露了因果的、补丁级的局部不确定性度量时,路由器是否必须消费完整的语义表示。因此,我们提出一个问题:决定动态字节补丁的熵是否也能作为路由稀疏专家计算的紧凑坐标。 我们引入 EntropyMoE,一种用于无分词器语言建模的补丁原生稀疏专家架构。EntropyMoE 建立在 BLT 风格的字节补丁流程之上,将全局补丁 Transformer 中的密集前馈块替换为 Top-2 MoE 层,并将每个动态补丁视为一个路由单元。与传统的隐藏状态路由器不同,其路由器仅通过学习的仿射变换将补丁关联的标量熵映射为专家 logits。补丁隐藏状态被有意排除在专家选择之外,但仍作为所选前馈专家的输入。因此,专家分配由局部不确定性组织,而语义和上下文信息则在专家计算中得以保留。 参见图 1 说明:EntropyMoE 概览。原始字节被分组为基于熵的动态补丁。全局补丁 Transformer 将密集前馈块替换为 Top-2 专家层,每个补丁使用标量补丁熵进行路由。EntropyMoE 不随补丁难度改变激活专家数量:每个有效补丁恰好激活两个专家。自适应粒度来自 BLT 补丁器,它用更多、更短的补丁表示不确定的字节区域。路由器决定哪个专家对处理每个补丁,而补丁长度仅用于以表示的字节数衡量工作负载。因此,补丁化决定计算粒度,标量熵决定稀疏参数路径,字节长度决定路由工作负载的计数方式。 在二十五层、每层八个专家的配置下,每个专家一个斜率和一个偏置产生 400 个有效路由器参数,而隐藏状态对照超过 4×10^5。EntropyMoE 移除了隐藏状态选择投影,同时保留相同的专家池和 Top-2 激活容量,以检验一维不确定性信号能否组织专家暴露。 我们的受控实验在匹配的数据、更新次数、激活参数和稠密拷贝初始化条件下,将 EntropyMoE 与 Dense BLT、Hidden-only MoE 和 Hidden+Entropy MoE 进行比较。EntropyMoE 取得了最低的保留集每字节比特数(BPB),而隐藏状态变体尽管匹配 EntropyMoE 的专家容量,仍与稠密基线接近。其相对于 Hidden-only MoE 的优势在第二个持续训练随机种子下得以复现。下游准确率总体相当,在 HellaSwag 上有统计支持的提升,而非所有任务上的普适性提升。因此,仅靠稀疏容量并不能解释所观察到的建模改进。 在两个测试随机种子下,字节加权统计相比补丁计数统计一致地改善 BPB。EntropyMoE 也比隐藏状态对照更清晰地区分低熵和高熵的分配分布,尽管路由集中在一个较小的专家子集上。其标量路由器将路由参数减少了三个数量级,并在稀疏模型中提供了最佳的迭代时间和有效字节吞吐量。然而,调度、通信和内存移动使稀疏执行仍然慢于 Dense BLT。 这些发现支持在所评估的持续训练协议下熵条件路由几何的有效性,但并未确立不可或缺的专家身份或相对于稠密骨干的计算匹配优势。因此,我们将补丁熵作为一种有效的低维路由坐标提出,同时对更强的因果结论留待未来的受控研究。 我们的主要贡献如下: 1. 我们提出了面向无分词器 LLM 的补丁原生稀疏条件计算,将动态字节补丁作为专家路由的基本单元。 2. 我们引入了 EntropyMoE,一种仅使用熵的 Top-2 路由器,并采用字节覆盖加权的负载统计,在统一的字节补丁架构中分离补丁粒度、专家选择和所表示字节的负载。 3. 通过受控的稠密与稀疏比较、跨随机种子持续训练实验、路由分析和实现成本审计,我们表明熵路由改善了字节级建模,诱导了结构化的熵条件分配,并在所评估的稀疏家族中降低了路由开销。 ## 相关工作 #### 稠密分词化 LLM。 稠密分词化 LLM 仍然是建模质量、扩展行为和训练实践的主要参考。Transformer 确立了自注意力作为标准序列建模骨干,而 BERT 和 GPT 风格模型则展示了大规模预训练的有效性(Vaswani 等 2017 (https://arxiv.org/html/2608.06398#bib.bib13); Devlin 等 2019 (https://arxiv.org/html/2608.06398#bib.bib14); Brown 等 2020 (https://arxiv.org/html/2608.06398#bib.bib15))。扩展律和计算最优分析随后阐明了模型容量、数据量和训练计算之间的权衡(Kaplan 等 2020 (https://arxiv.org/html/2608.06398#bib.bib16); Hoffmann 等 2022 (https://arxiv.org/html/2608.06398#bib.bib17))。最近的 LLM,包括 PaLM、LLaMA/Llama、Qwen2.
相似文章
BitsMoE: 基于谱能引导的MoE大语言模型高效量化比特分配
BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。
通过L0正则化混合专家模型加速稠密LLMs
本文提出L0-MoE,一种使用L0正则化的轻量级混合专家模型方法,用于加速稠密LLMs,最高可实现2.5倍加速,同时保持竞争力的性能。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
通过有限专家库实现通信高效的专家路由
本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。
基于肘部的MoE路由:一种免训练的推理时插件用于专家选择
本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。