ESTS at WMT26: 路由感知的专家剪枝用于模型压缩
摘要
本文描述了向WMT26模型压缩共享任务提交的六个作品,使用路由感知的专家剪枝和MXFP4量化将GPT-OSS-20B压缩成更小的翻译模型,参数范围从4.186B到7.770B。
arXiv:2609.12310v1 公告类型:新
摘要:我们描述了以团队名称ESTS向无约束WMT26模型压缩共享任务提交的六个作品,针对英语--简体中文和英语--埃及阿拉伯语。每个翻译方向提交三个压缩操作点,均源自GPT-OSS-20B。我们使用任务特定的路由质量来排名专家,并使用跨语言路由差异来分配各层保留的容量,然后物理移除低重要性专家。生成的专家模型在GPT-5.1生成的合成翻译数据上进行恢复调优,并通过对保留的专家投影权重应用MXFP4量化进一步压缩。此外,我们为指令条件WMT26设置实现了一个健壮的推理系统,包括类别推理、输出验证、重试、分段回退和源所有JSON重建。在我们的六个提交中,参数计数范围从4.186B到7.770B,打包工件大小从4.55到6.33~GiB。使用GPT-5.1伪参考进行内部xCOMET-XL评估,为提交的压缩操作点提供了内部比较。
查看缓存全文
缓存时间: 2026/09/14 08:32
# ESTS 在 WMT26 中的表现:基于路由信息的专家剪枝模型压缩
来源:https://arxiv.org/html/2609.12310
###### 摘要
我们描述了ESTS团队在WMT26无约束模型压缩共享任务(英语-简体中文与英语-埃及阿拉伯语方向)的六项提交。每个翻译方向提交三个压缩工作点,均源自GPT-OSS-20B模型。我们利用任务相关的路由质量对专家进行排序,并通过跨语言路由差异在各层间分配保留容量,随后物理移除低重要性专家。生成的专家模型在GPT-5.1生成的合成翻译数据上进行恢复微调,并通过对保留的专家投影权重应用MXFP4量化实现进一步压缩。此外,我们为WMT26的指令条件化场景构建了健壮的推理系统,涵盖类别推断、输出验证、重试机制、分段回退以及源归属的JSON重构。在我们六项提交中,参数量范围为4.186B至7.770B,打包制品大小为4.55至6.33 GiB。使用GPT-5.5伪参考的内部xCOMET-XL评估对各提交压缩工作点进行了横向比较。
## 1 引言
我们以ESTS团队名称(*提取小型翻译专家*)参与WMT26无约束模型压缩共享任务(WMT, 2026b (https://arxiv.org/html/2609.12310#bib.bib14))。针对英语-简体中文(ZHO)和英语-埃及阿拉伯语(ARZ)各提交三个系统,分别代表不同的压缩工作点。所有六个系统均基于GPT-OSS-20B(OpenAI et al., 2025 (https://arxiv.org/html/2609.12310#bib.bib5))衍生而来。我们的提交基于Martin等人(2026) (https://arxiv.org/html/2609.12310#bib.bib12)提出的专家剪枝方法,*通过激进剪枝专家从LLM中提取小型翻译专家*。该方法利用任务特定的路由行为对专家进行排序,通过跨语言路由差异在各层间分配保留容量,随后物理移除低重要性专家并对生成的专家模型进行恢复微调。在WMT26中,我们将此框架应用于多样化输入的翻译,包括非正式社交媒体交流和日常对话,并增加了指令遵循与格式保持要求。我们扩展了校准与恢复数据的覆盖范围,涵盖新闻、社交与语音内容,以期更好地匹配任务分布。我们的内部结果初步证明剪枝-恢复框架可适配更多样化的翻译场景。此外,我们对保留的专家投影权重应用MXFP4量化。除模型压缩外,我们围绕WMT26的指令条件化场景构建提交的翻译系统。当类别元数据不可用时,系统会推断粗略的输入类别,应用相应的翻译指令,并通过验证、重试、分段回退和确定性JSON重构生成结构有效的输出。最终提交的模型参数量介于4.186B至7.770B之间,打包制品大小为4.55至6.33 GiB。我们采用GPT-5.1伪参考报告了内部xCOMET-XL结果,以比较各提交压缩工作点的表现。
## 2 任务与数据
### 2.1 任务类别
WMT26场景结合了领域特定翻译、指令遵循与结构化输入(WMT, 2026a (https://arxiv.org/html/2609.12310#bib.bib15))。针对我们的系统与恢复数据构建,我们区分四种粗略输入类型:新闻、社交、语音与JSON/软件数据。新闻类要求正式的新闻风格翻译并保持HTML结构;社交类强调非正式风格并保持诸如用户名、URL、标签和HTML等元素;语音类针对日常自动转录的口语内容;JSON类要求在保持键值、占位符和非字符串值不变的前提下翻译字符串内容。我们的恢复数据覆盖新闻、社交与语音类别,并使用相应的任务指令。监督微调(SFT)恢复阶段未包含JSON样本;JSON特定处理则由第4.4节(https://arxiv.org/html/2609.12310#S4.SS4)描述的推理流程实现。
### 2.2 源数据集构建
我们从四个数据集中构建包含44,000个示例的英语源数据集,以近似三个恢复类别。表1(https://arxiv.org/html/2609.12310#S2.T1)总结了最终构成。
表 1:用于构建恢复数据的英语源数据集构成。新闻样本来自筛选后的WMT News Crawl 2025(Kocmi et al., 2025 (https://arxiv.org/html/2609.12310#bib.bib2))文档,并以`<blockquote>`块表示。对于Webis-TLDR-17(Völske et al., 2017 (https://arxiv.org/html/2609.12310#bib.bib9)),我们使用Reddit帖子正文而非关联的TLDR摘要。Bluesky(Dale, 2024 (https://arxiv.org/html/2609.12310#bib.bib16))帖子通过结构和时间关系分组为多帖单元,帖子以`<post>`表示,内部换行表示为`<br>`。对于语音数据,我们清理并组合来自SPoRC(Litterer et al., 2025 (https://arxiv.org/html/2609.12310#bib.bib13))的播客对话轮次,形成通常包含多轮对话的语音块。所有来源均应用确定性去重和针对英语内容、格式错误文本、样板内容及其他不适用材料的来源特定过滤。
### 2.3 合成恢复数据
我们使用GPT-5.1(OpenAI, 2025a (https://arxiv.org/html/2609.12310#bib.bib17))生成合成翻译目标。对于每个源样本,将其类别对应的WMT26指令与源文本拼接后输入模型。生成采用温度0.5,无推理强度,最大输出长度4,096 token。我们排除了API错误、空响应、未完成状态或不完整/最大输出token提示的生成结果。对于ZHO方向,我们标注了完整的44,000个源样本,过滤后保留43,997个合成恢复样本。对于ARZ方向,我们选取一个10,000样本子集进行标注,以在保持完整数据集类别与来源族构成的同时,近似匹配其对应的源token量占比,过滤后保留9,999个合成恢复样本。
## 3 模型压缩与恢复
我们使用GPT-OSS-20B作为所有提交的起始模型。在每个混合专家(MoE)层中,GPT-OSS-20B拥有E=32个专家,每个token激活K=4个专家。令k∈[0,28]表示每层平均移除的专家数量。我们的模型压缩方法遵循Martin等人(2026) (https://arxiv.org/html/2609.12310#bib.bib12)。首先,在任务相关的校准数据上进行路由分析,以确定每层专家重要性分数及层级保留专家容量。随后相应移除专家。其次,使用合成标注的翻译对执行恢复SFT。与Martin等人(2026) (https://arxiv.org/html/2609.12310#bib.bib12)不同,我们还对保留的专家投影权重应用MXFP4量化以进一步减少模型占用空间。
### 3.1 基于路由的校准
我们使用两种互补的路由信号。任务特定校准数据上的路由质量用于在每层内对专家进行排序,而跨语言路由差异决定了分配给每层的保留容量。
#### 收集路由统计数据
为确定剪枝哪些专家,我们首先测量模型处理翻译数据时每个专家的利用率。在MoE语言模型中,对于每层ℓ∈{1,...,L},路由器将输入隐藏状态h_i^ℓ转换为所有E个专家的logits z_i^ℓ。随后选择top-K个专家激活并使用归一化权重聚合。因此,token i上每个专家ε的输出权重可定义为:
w_{i,ε}^ℓ =
\begin{cases}
f(h_i^ℓ)_ε & \text{if } \varepsilon \in \text{top-K} \\
0 & \text{otherwise}
\end{cases} \tag{1}
其中所有w_{i,ε}^ℓ之和为1。为确定整个序列上的重要性,我们对所有token的w_{i,ε}^ℓ进行平均聚合。我们将此分数称为*路由质量*。我们通过PyTorch钩子在vLLM(Kwon et al., 2023 (https://arxiv.org/html/2609.12310#bib.bib6))中实现路由器权重的收集。
#### 校准数据
我们定义*校准*数据集C_s为用于计算语言s的专家重要性的段落集合。对于每个段落p∈C_s和目标语言t,我们提示LLM将p从s翻译为t。随后我们收集整个序列(包括指令、段落和生成的翻译)的路由权重。对于每个翻译方向,我们从第2.2节(https://arxiv.org/html/2609.12310#S2.SS2)描述的任务相关源数据集中抽取660个样本,类别配额按完整数据集的提示与目标token总和的大致比例选择。
#### 层级专家分配
令k为每层平均需要剪枝的专家数。简单做法是从每层均匀剪枝k个专家。但这隐含假设所有层对机器翻译能力的贡献相等。然而,Bandarkar等人(2026) (https://arxiv.org/html/2609.12310#bib.bib3)发现语言特定处理主要集中在模型首尾少数层。基于这些层负责语言处理的模块化框架,我们假设对翻译最重要的专家位于此处。因此,我们采用*动态*容量分配方案,在语言更专业的层中保留更多专家。为此,我们使用路由差异度量,计算目标语言与英语路由质量分布之间的Jensen-Shannon(JS)散度(Bandarkar et al., 2026 (https://arxiv.org/html/2609.12310#bib.bib3))。为计算此差异度量,我们使用4,400个英语-中文配对序列(ZHO)和9,999个英语-埃及阿拉伯语配对序列(ARZ)。我们从每个英语源与其对应合成目标序列的独立无指令预填充中获取路由分布,为每个语言s在层ℓ得到分数d_ℓ^s∈[0,1]。具体实现见附录A(https://arxiv.org/html/2609.12310#A1)。我们使用d_ℓ^s在保持k为每层平均剪枝专家数的同时,跨MoE层分配保留容量。由于每个未剪枝层有E个专家,总保留容量预算为L(E-k)。我们将每层初始化为最小有效保留容量K(因为模型每token激活K个专家),并将剩余预算B=L(E-k)-LK按d_ℓ^s比例分配。数值舍入细节见附录B(https://arxiv.org/html/2609.12310#A2)。在此动态容量分配下,我们得到满足∑_ℓ c_ℓ = L(E-k)的保留容量c_ℓ。
#### 剪枝方法
在计算出每层专家排名和分配的容量c_ℓ后,我们简单地剪除每层最不重要(即最低路由质量)的r_ℓ=E-c_ℓ个专家。
### 3.2 专家移除与提交模型
我们通过沿维度0切片`experts.gate_up_proj`和`experts.down_proj`的`nn.Parameter`块(及相应的专家偏置张量)从检查点中物理移除专家。我们以相同方式切片`router.weight`和`router.bias`。由于动态容量分配通常导致每层专家数量不同,我们在模型配置文件中使用列表存储每层专家数。在自定义建模文件中,每个层在构建路由器和专家块时从该列表中读取自身的专家数。这些修改侵入性最小:一旦自定义配置和建模文件以每层专家数实例化每个层,标准Transformers(Wolf et al., 2020 (https://arxiv.org/html/2609.12310#bib.bib10))加载路径即可直接加载切片后的权重。表2(https://arxiv.org/html/2609.12310#S3.T2)总结了六个提交的检查点,包括其保留专家容量、参数减少量和检查点大小。
表 2:提交的ESTS系统与GPT-OSS-20B起始模型。参数减少量相对于20.915B参数基础模型测量。基础检查点大小指BF16存储,而提交的检查点大小指MXFP4量化后的最终混合精度制品。
### 3.3 恢复微调
在剪枝大量专家后,我们对模型进行微调以恢复翻译性能,此做法在先前针对机器翻译剪枝LLM层的研究中已有应用(Moslem et al., 2025 (https://arxiv.org/html/2609.12310#bib.bib8); Ponce et al., 2025 (https://arxiv.org/html/2609.12310#bib.bib7))。这样做的动机在于希望如果剪枝产生的部分错误能在微调中修正,我们就能更激进地剪枝。我们使用LLaMA-Factory(Zheng et al., 2024 (https://arxiv.org/html/2609.12310#bib.bib11))在第2.3节(https://arxiv.org/html/2609.12310#S2.SS3)描述的合成标注翻译数据上执行恢复SFT。训练使用BF16,最大序列长度4096,学习率5×10^{-6}(线性调度及5%预热),单设备批大小1,梯度累积3步。我们在6块NVIDIA RTX A6000 GPU上训练,有效批大小为18。对于ZHO,使用43,997个训练对,采用单周期SFT调度。对于ARZ,使用9,999个对,采用三周期调度。我们执行全参数微调而非参数高效适配,因为目标是移除整个专家参数块后恢复能力。
### 3.4 MXFP4量化
在BF16恢复微调后,我们使用NVIDIA ModelOpt(NVIDIA Corporation, 2024 (https://arxiv.org/html/2609.12310#bib.bib18))对保留的专家投影权重应用训练后MXFP4量化。我们以32个值为一组的MXFP4块量化并打包`gate_up_proj`和`down_proj`矩阵。其余模型参数(包括注意力、嵌入、路由器参数、专家偏置和语言模型头)保持BF16格式。因此,最终检查点采用混合精度存储。最终打包制品大小见表2(https://arxiv.org/html/2609.12310#S3.T2)。
## 4 提交的翻译系统
### 4.1 类别推断与提示
WMT26任务在翻译之外融入了指令遵循要求,包括针对风格和格式的特定行为。因此,我们的完整生成路由校准和恢复微调使用了任务定义的类别特定指令。然而,模型压缩提交接口每次物理行仅提供一个翻译单元,不包含类别或指令元数据(WMT, 2026b (https://arxiv.org/html/2609.12310#bib.bib14))。因此,我们的推理系统将每个输入分配到一个粗略任务类别相似文章
超越 FP16 + ONNX 的 Transformer 体积与推理优化(剪枝/图优化收效甚微)[P]
作者分享在 162 MB Transformer 上把 FP16 + ONNX + 剪枝用到极致却收益递减的经历,求教下一步该选量化、蒸馏、低秩分解还是硬件级技巧。
基于归因引导和覆盖最大化的结构化MoE压缩剪枝
提出了一种针对MoE模型的结构化剪枝框架,通过基于归因的近似方法最大化通道分数覆盖,在结合4比特量化时实现50%或25%的剪枝,并在Qwen3-30B-A3B上将内存占用降低5.27倍。
SlimQwen:探索大规模MoE模型预训练中的剪枝与蒸馏
本文探讨了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝和知识蒸馏技术。研究表明,渐进式剪枝以及结合多标记预测蒸馏等策略,能够提升下游任务的性能。例如,通过将Qwen3-Next-80A3B压缩为更高效的23A2B模型,展示了这一方法的有效性。
研究机器翻译高效推理部署中的量化权衡
本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。
形状变换专家压缩:LorExperts与BTExperts
本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。