通过令牌剪枝优化韩语中心的大语言模型
摘要
本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。
arXiv:2604.16235v1 公告类型:新提交
摘要:本文对通过令牌剪枝进行适配的最先进多语言大语言模型进行了系统基准测试。令牌剪枝是一种压缩技术,能够消除与目标应用无关的语言所对应的令牌和嵌入参数。本研究聚焦于韩语中心的自然语言处理(NLP)任务,评估了包括Qwen3、Gemma-3、Llama-3和Aya在内的多个架构,采用三种词汇配置:原始配置、英文-韩文(EnKo)和英文-韩文-中文(EnKoZh)。性能评估采用通用能力、文化素养、指令遵循和机器翻译等既定基准。研究结果表明,令牌剪枝通过消除语言混淆显著改进了生成稳定性,在机器翻译任务中往往还能增强韩语特定任务的性能。虽然指令遵循能力显示出与潜在跨语言表示相关的架构依赖差异,但词汇规模的大幅减小验证了令牌剪枝作为内存受限的特定领域部署的高效优化策略的有效性,尽管推理延迟的改进幅度较为温和。
查看缓存全文
缓存时间: 2026/04/20 08:30
# 通过令牌剪枝优化韩语中心大语言模型 来源: https://arxiv.org/html/2604.16235 Hoyeol Kim 乔治亚理工学院计算学院 [email protected] Hyeonwoo Kim 独立研究者 [email protected] ###### 摘要 本文系统性地对通过令牌剪枝适配的最先进多语言大语言模型(LLMs)进行了基准测试——令牌剪枝是一种压缩技术,可消除与目标应用无关的语言对应的令牌和嵌入参数。针对韩语中心的自然语言处理(NLP)任务,我们评估了包括Qwen3、Gemma-3、Llama-3和Aya在内的架构,涵盖三种词汇配置:原始配置、英韩(EnKo)配置和英韩中(EnKoZh)配置。性能通过通用能力、文化素养、指令遵循和机器翻译的既定基准进行评估。我们的研究发现,令牌剪枝通过消除语言混淆显著改善了生成稳定性,在机器翻译的情况下,经常增强了韩语特定任务的性能。虽然指令遵循能力显示出与潜在跨语言表示相关的架构依赖方差,但词汇大小的显著减少验证了令牌剪枝作为高效优化策略的有效性,可用于内存受限的领域特定部署,尽管推理延迟的提升幅度不大。 ## 1 引言 大规模多语言LLMs的激增显著扩展了先进自然语言处理的可及性。LLaMA-3、Qwen和Gemma等模型依靠庞大的多语言训练语料库来实现通用适用性。然而,这种广泛性引入了"多语言诅咒",即模型的大量参数——特别是在词汇和嵌入层中——被分配给对特定下游应用而言多余的语言。对于严格的单语言或双语言环境中的部署,例如韩语中心的服务,这种冗余会带来不必要的内存开销和计算低效。 在韩语NLP的背景下,这个挑战有两个方面。首先,尽管韩语是高资源语言,但在以英语或中文为中心的主流模型中,韩语通常仅占训练数据的很小比例,这可能会削弱文化细微差别。其次,虽然本地部署需要轻量级模型,但优化策略不能以牺牲语言能力为代价。 令牌剪枝提供了针对性的解决方案。通过系统地删除与非目标语言相关的令牌,这种方法压缩词汇和嵌入矩阵,减少内存占用,而不改变核心Transformer架构。虽然先前的工作已经探索了一般的剪枝,但量化其对韩语任务影响的系统研究仍然有限。本文通过对最先进多语言LLMs的令牌剪枝进行基准测试来填补这一空白。我们特别评估了激进的词汇压缩如何影响跨三个不同支柱的性能:通用能力、文化竞争力和翻译质量。 ## 2 相关工作 ### 2.1 令牌剪枝 令牌剪枝越来越被认为是Transformer效率的重要组成部分。Li等人(2025)提供了令牌剪枝方法的全面综述,将其分为基于启发式、可学习和强化学习的方法,并强调了其在降低推理复杂性同时保留准确性方面的作用。在多模态环境中,Wen和Gao(2024)质疑复杂的基于注意力的重要性分数的效用,证明简单的随机基线可以接近理论基础薄弱的专门方法的性能。基于Transformers中令牌冗余的理论观点,Tai等人(2025)形式化了基准以捕获不同剪枝策略下的FLOP减少和延迟权衡。补充这些输入级方法,Lee和Kim(2024)引入了动态词汇剪枝以在测试期间限制输出搜索空间,建议词汇级和令牌级剪枝之间的协同效应用于实际部署。 ### 2.2 韩语中心LLMs和语言专门化 提高韩语LLM性能的努力分为两个分支:适配以英语为中心的模型和开发自主AI。Vo等人(2024)表明,使用分词器增强进行持续预训练可以有效地适配英语基础模型,而Kim等人(2025)引入了Thunder-LLM,通过平衡的双语语料库实现了接近SOTA的结果。领域特定应用也有所扩展,例如用于代码生成的双语GECKO模型(Oh和Kim,2024)和用于金融NLP的FINKRX模型(Son等人,2025a)。 ## 3 方法 ### 3.1 目标模型和配置 我们评估了多种开源权重多语言LLMs,特别是Qwen3系列(从0.6B到14B参数),Gemma-3(270M到12B)和Llama-3系列(3.1-8B和3.2-3B)。其他模型包括Tri、Ministral-8B和Aya-23。为了评估词汇压缩的影响,每个模型都处理为三种不同配置:保留完整多语言词汇的原始配置;修剪为仅保留英语和韩语令牌的EnKo配置;和保留英语、韩语和中文令牌的EnKoZh配置。剪枝过程需要分词器重构、位置编码重新对齐和输出层权重的重新映射,以对应缩减的词汇指数。 ### 3.2 词汇剪枝程序 我们实施了一种"语言感知过滤"策略,分为三个不同的阶段进行。首先,使用Unicode块范围和脚本属性(如谚文、拉丁文和汉字)按语言对令牌进行分类。随后,删除与目标配置无关的令牌,无论是EnKo还是EnKoZh,并将保留的令牌映射到新的连续索引空间。最后,嵌入矩阵和输出投影层进行物理重新排列以与新索引对齐,有效地减少参数数量。此过程使内部Transformer块和位置编码保持不变,保留模型的序列建模能力。 ### 3.3 基准和指标 为了量化性能,我们使用四类韩语中心基准。通用能力通过KMMLU进行评估,该基准测试通用知识和逻辑推理。文化和语言理解通过HAERAE(用于文化素养)和CLIcK(用于语言细微差别)进行评估。指令遵循能力通过LogicKor和KoMTBench进行测量,这些评估推理和约束满足。最后,机器翻译性能使用WMT 24++(韩英)基准进行评估,通过XCOMET-XXL计分。 ### 3.4 延迟测量 令牌级推理延迟使用Seed-X-PPO-7B模型在Google/WMT-pp数据集上进行量化。我们在相同硬件条件下比较配置以隔离来自缩减softmax计算负载的加速。 ## 4 实验和分析 表1:通用能力(KMMLU)、文化(HAERAE)和语言(CLIcK)基准结果。分数:准确度。更高的值更准确。 ### 4.1 通用能力和文化对齐 表1总结了对基础韩语掌握和文化知识的评估。数据显示剪枝模型的性能退化最少。对于Qwen3系列,配置之间的方差可以忽略不计(<0.01波动),而Gemma-3-12b-it在语言能力方面显示出轻微改进(0.6311→0.6321)。这种稳定性表明剪枝成功消除了词汇冗余,而不删除韩语推理所需的语义结构。此外,Llama-3.2-3B-Inst在剪枝后KMMLU准确度略有提高(0.3307→0.3311),暗示缩小词汇搜索空间可能会减少较低参数模型中的生成噪声。 ### 4.2 指令遵循能力 复杂指令遵循(LogicKor和KoMTBench)的性能表现出更大的方差,受到模型架构和剪枝深度之间交互的影响(表2)。对于Qwen3系列,保留中文令牌(EnKoZh)始终优于更严格的EnKo剪枝。值得注意的是,Qwen3-4B在LogicKor中得分7.85(EnKoZh),超过其原始分数(7.77)。这表明在中文语料库上进行了大量预训练的模型依赖潜在的跨语言对齐进行推理。相反,Llama-3.1-8B-Inst等较大的模型在EnKo设置中显示出改进的性能(5.36→5.57),表明对于足够大的模型,词汇缩减可能会增强指令焦点。 表2:指令遵循结果(LogicKor、KoMTBench)。分数:越高越好。 ### 4.3 机器翻译 机器翻译(WMT24++)结果(表3)为令牌剪枝的有效性提供了最有力的证据。剪枝配置始终与基线匹配或优于基线。Llama-3.1-8B-Inst(0.5879→0.6342)和Aya-expanse-8b(0.6957→0.7496)显示出显著增益。这表明消除多余的语言令牌会规范化输出分布,最小化目标外幻觉,并增强英韩翻译路径。 表3:机器翻译评估结果(WMT24韩英)。分数:COMET。越高越好。 ### 4.4 语言混淆性能 我们测量了词级通过率(WPR)以评估语言生成中的稳定性,遵循Marchisio等人的方法。表4详细说明了EnKo适配所产生的改进。EnKo方法显著缓解了语言混淆。Qwen3-4B基线稳定性最低(0.8882),表现出最显著的恢复(ΔWPR=+0.1041)。即使是Qwen3-0.6B这样的稳定基线也在剪枝后实现了接近完美的一致性(>0.999)。 表4:按EnKo的词级通过率(WPR)改进 ### 4.5 计算延迟 使用Seed-X-PPO-7B模型测量效率增益(表5)。虽然词汇减少很大(EnKo中减少36%),但延迟改进微乎其微(0.89%)。这证实了虽然剪枝缓解了与嵌入相关的内存开销,但它不会显著影响注意力机制中的计算瓶颈。 表5:Seed-X-PPO-7B的延迟比较。在Google/WMT-pp上测量。 ## 5 结论 我们提供了韩语NLP令牌剪枝的系统性基准,确认高资源语言可以从大规模多语言词汇中有效地解耦,而不影响性能。剪枝消除了多余的令牌,导致接近完美的生成一致性(WPR>0.99)和改进的翻译质量,同时显著减少了参数数量。 然而,我们的结果也突出了关键的架构依赖性。虽然剪枝一般是稳健的,但Qwen系列模型中EnKo和EnKoZh配置之间的性能差距表明潜在的跨语言表示(特别是中文)在某些架构中仍然对推理能力不可或缺。最后,虽然推理延迟增益微乎其微(<1%),但词汇大小的显著减少提供了重大的内存节省。这将令牌剪枝定位为不仅仅是压缩技术,而是在资源受限的本地环境中部署稳定的、高性能的自主AI模型的重要工具。 ## 参考文献 - Aryabumi等人(2024)Viraat Aryabumi、John Dang、Dwarak Talupuru、Saurabh Dash、David Cairuz、Hangyu Lin、Bharat Venkitesh、Madeline Smith、Jon Ander Campos、Yi Chern Tan等人。2024年。Aya 23:开放权重发布以进一步推进多语言进展。*arXiv预印本arXiv:2405.15032*。 - Cheng等人(2025)Shanbo Cheng、Yu Bao、Qian Cao、Luyang Huang、Liyan Kang、Zhicheng Liu、Yu Lu、Wenhao Zhu、Jingwen Chen、Zhichao Huang、Tao Li、Yifu Li、Huiying Lin、Sitong Liu、Ningxin Peng、Shuaijie She、Lu Xu、Nuo Xu、Sen Yang、Runsheng Yu、Yiming Yu、Liehao Zou、Hang Li、Lu Lu和Yuxuan Wang。2025年。Seed-x:用7B参数构建强大的多语言翻译LLM。*预印本*,arXiv:2507.13618。 - Deutsch等人(2025)Daniel Deutsch、Eleftheria Briakou、Isaac Rayburn Caswell、Mara Finkelstein、Rebecca Galor、Juraj Juraska、Geza Kovacs、Alison Lui、Ricardo Rei、Jason Riesa等人。2025年。WMT24++:将WMT24的语言覆盖范围扩展至55种语言和方言。在*计算语言学协会诉讼结果中:ACL 2025*,页码12257–12284。 - Dubey等人(2024)Abhimanyu Dubey、Abhinav Jauhri、Abhinav Pandey、Abhishek Kadian、Ahmad Al-Dahle、Aiesha Letman、Akhil Mathur、Alan Schelten、Amy Yang、Angela Fan等人。2024年。Llama 3模型群。*arXiv电子版*,页码arXiv–2407。 - Guerreiro等人(2024)Nuno M Guerreiro、Ricardo Rei、Daan van Stigt、Luisa Coheur、Pierre Colombo和André FT Martins。2024年。xcomet:通过细粒度错误检测进行透明的机器翻译评估。
相似文章
小型LLM:剪枝与从头训练
本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。
LLM预预训练的不稳定性:并非总是有帮助——一项跨多语言的研究
本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。
通过幂变换和保号分数聚合实现自适应特征保留的大语言模型结构化剪枝
本文提出了一种针对大语言模型的结构化剪枝方法,解决了在将非结构化剪枝技术适配到结构化剪枝时出现的分布不匹配、符号信息丢失和异常值影响等问题,在Llama-3-8B和Vicuna-v1.5-13B等模型上实现了相当精度,并获得了1.56-1.57倍的加速。
修剪不安全票:一种资源高效的框架,用于更安全、更鲁棒的大型语言模型
本文介绍了一种资源高效的修剪框架,该框架能够识别并移除大型语言模型中与不安全行为相关的参数,同时保持模型的实用性。该方法利用无梯度归因和彩票假说视角,在最小化性能损失的前提下,显著减少了不安全内容的生成,并增强了对越狱攻击的鲁棒性。
利用多语言LLM嵌入发现词汇空缺
本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。