SuTRA:结构统一的词元化与根词意识
摘要
SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。
查看缓存全文
缓存时间: 2026/08/20 09:52
# SuTRA:具有根感知能力的结构统一分词方法 来源:https://arxiv.org/html/2608.18087 Rathore Gole Telwadkar Bhatia Ruparel Surekha Bhargava Motilal Oswal Financial Services Ltd. 印度 印度理工学院(IIT)孟买分校 印度 ###### 摘要 现有的子词分词器通过统计压缩进行优化,但忽略了形态结构,尤其是词根与词缀之间的关系。这对于形态丰富的印地语言尤为有害,因为这些语言的基本单位是复杂的正字音节(akshara)而非字母。基于频率的方法过度分割单词,任意拆分词根和词缀——这一现象我们称为**形态破碎**。我们提出SuTRA111项目页面:https://mo-vaibhavr-43300.github.io/SuTRA/(具有根感知能力的结构统一分词),这是一种形态感知算法,能够保留akshara的不可分割性,并对跨越形态边界的合并进行惩罚。同时我们发布了针对印地语、马拉地语和古吉拉特语的新形态分割数据集。SuTRA减少了形态破碎,在形态对齐(边界F1)上获得+14.7%的峰值提升,在语义可恢复性(印地语)上较Bpe提升+34%。这些结构性改进在机器翻译中平均带来了+8.08 chrF2的提升。 ###### 关键词: 大型语言模型、分词、形态完整性、印地语言 ## 1 引言 现代NLP流程依赖分词器作为解决输入-表示鸿沟的基础桥梁,将原始文本转换为填充语言模型高维向量空间的离散标记[pennington2014glove, mikolov2013distributed, sarzynska2021detecting]。当前的事实标准——如字节对编码(Bpe)[Gage1994-ds, Sennrich2016-uh]、WordPiece[Schuster2012-ev]和Unigram[Kudo2018-ue]——主要作为统计数据压缩技术。虽然它们能有效缩短序列长度并降低未登录词(OOV)率,但根本上对语言的形态结构保持“无知”[Hofmann2022-td, Hofmann2020-lg]。尽管出现了无分词架构的探索[deiseroth2024t, clark2022canine, xue2022byt5, tay2021charformer],最先进的模型[brown2020language, guo2025deepseek, yang2025qwen3, team2025gemma]仍依赖Bpe式分割并继承了其结构局限。 由于这些分词器忽略形态规则,它们常将多词素单词分割为与词根和词缀错位的子标记。我们将这种分词器层面的错位称为**形态破碎**(图1 https://arxiv.org/html/2608.18087#S1.F1)。在形态丰富的语言中,尤其是在天城文等印地文字书写的语言中,这一问题被放大。这些文字属于元音附标文字:基础辅音和从属元音(matra)共同构成作为原子书写单位的正字音节(akshara)[akshara_ref]。现成分词器经常在这些单位内部进行分割——例如将matra与其基础辅音分离。许多印度-雅利安语言还表现出**连音变化**(Sandhi),即在词和词素边界处的语音片段会发生改变或融合[sandhan2022translist, gaikwad2021state],这进一步模糊了底层的词素边界。加上有充分记录的**印度税**(Indic Tax)现象——即更高的标记生育率(每个单词更多标记)[kumar2026sanskrit, pattnayak2025tokenization, tamang2024evaluating, chaudhari2023significance]——这些特性导致了更严重的形态破碎。我们使用**语义盲**(Semantic Blindness)来描述相应的表示层面影响:词根语义更难通过简单线性探针恢复,嵌入对未改变底层词素的小正字法变化变得过度敏感[asgari2025morphbpe, arnett2025evaluating, morphtok2024, isac2025slip]。 参见图注 图1:形态破碎与词根保留对比。 对于印地词“asādhāraṇ”,标准Bpe将否定前缀与词根融合([asā]+[dhāraṇ]),而SuTRA清晰地分离了前缀和词根([a]+[sādhāraṇ])。我们称这种频率驱动的前缀-词根融合为**形态破碎**;SuTRA的词根保留分割产生了更稳定的子词单元并减少了语义盲。图使用PaperBanana[paperbanana]生成。 为了解决复杂语言中的形态破碎及其语义影响,我们做出三项贡献: - • **SuTRA(具有根感知能力的结构统一分词)**:我们引入了Bpe的结构引导扩展,通过轻量级语言学先验增强基于频率的合并。它结合了对akshara类单元的脚本感知分组、形态对齐的合并评分和词根保留的边界约束,以惩罚跨有效形态单位的分割。 - • **印度语形态黄金标准数据集**:我们构建了大规模、LLM辅助的形态分割数据集,专为三种印度语言(印地语、马拉地语和古吉拉特语)量身定制,为评估形态对齐提供了稳健的通用基准。 - • **内在和下游评估**:我们设计了一套全面的评估套件,涵盖形态对齐、语义可恢复性、正字法扰动下的鲁棒性和机器翻译。在这四个维度上,SuTRA减少了形态破碎并产生了更稳定、结构对齐的表示:它更好地尊重词素边界而没有任意过度分割,与标准基线相比提高了内在语义可恢复性和下游质量。 ## 2 相关工作 ### 2.1 频率驱动的分词 标准词汇构建依赖于压缩算法,如Bpe[Gage1994-ds, Sennrich2016-uh]、WordPiece[Schuster2012-ev]、Unigram[Kudo2018-ue]和SuperBpe[liu2025superbpespacetravellanguage]。通过将文本视为与语言无关的字符流,这些方法最大化统计覆盖率,但经常覆盖语言边界,系统性地引发形态破碎[Banerjee2018-hd, Hofmann2020-lg]。先前的缓解措施,如随机正则化(Bpe-Dropout[provilkov-etal-2020-bpe])或事后重新对齐(Flota[hofmann-etal-2022-embarrassingly]),仍然是辅助干预,未能纠正初始词汇创建时根深蒂固的结构分离。此外,标准评估指标如压缩比和困惑度[haga2025babylmchallengeexploringeffect, ali2024tokenizer]掩盖了这些表示低效性,因为它们测量序列可预测性而非子词完整性。 ### 2.2 字符级和无标记架构 为了绕过子词词汇的局限,一些工作提出了无分词或字符级架构,如Canine[clark2022canine]、ByT5[xue2022byt5]和Charformer[tay2021charformer]。这些模型直接处理原始字节或字符,理论上通过允许模型学习自身的形态内部表示来完全避免“破碎”问题[deiseroth2024t]。然而,这些架构遭受显著的**计算惩罚**,因为字符级处理大幅增加了序列长度,使其在长上下文任务中计算成本高昂。因此,最先进的模型继续使用基于子词的Bpe[guo2025deepseek, yang2025qwen3, team2025gemma],在继承其结构局限性的同时受益于其效率。 ### 2.3 印地LLM中的形态挑战 **形态丰富语言**(Mrls),特别是**印度语族**中的语言,遭受不成比例的**印度税**,表现为高生育率和语义锚定不良[morphtok2024, Lian2025-ch]。传统Bpe未能捕捉**连音变化**(Sandhi,语音融合),并且经常通过将**matra**(从属元音)与基础辅音解耦来违反**元音附标文字**(Abugida)的完整性[Banerjee2018-hd]。先前的工作探索了形态感知分词和注意力引导的分割[morphtok2024, asgari2025morphbpe, jabbar2024morphpiecelinguistictokenizer],但要么将形态视为分词前启发式方法,要么针对特定语言(英语、希伯来语、土耳其语)而非印度元音附标文字[jabbar2024morphpiecelinguistictokenizer, seker-etal-2022-alephbert, Toraman_2023]。虽然像Ag-Bpe[charlet_2025_agbpe_v3]这样的当代方法通过注意力引导评分瞄准语义感知,但它未能明确保留印度文字的原子边界。相比之下,我们的方法通过惩罚驱动的形态违规来处理,这表现出对保留标记级语义连贯性的更高敏感性。 ## 3 形态数据集准备 对于MRL子词分词的一个关键瓶颈是缺乏经过验证的黄金标准分割。大规模资源如Unimorph 4.0[batsuren2022unimorph40universalmorphology]和MorphyNet[batsuren-etal-2021-morphynet]主要是**范式中心**的——将词元映射到屈折形式,而没有定义明确的边界。同样,特定数据集如GujMORPH[baxi-bhatt-2022-gujmorph]依赖基于规则的词干提取,未能恢复斜格词根或处理语音融合(Sandhi)。为了解决这个问题,我们为印地语、马拉地语和古吉拉特语构建了**黄金标准形态分割数据集**。如表1所示(https://arxiv.org/html/2608.18087#S3.T1),我们的数据集通过LLM循环管道强制执行**词根恢复**(例如,将斜格“ghara”映射到词根“ghar”)。 表1:形态数据集。 我们首次提供了针对印度文字的高规模、LLM验证的形态覆盖。 ### 3.1 数据集管道 我们采用三阶段混合管道——语料库提取、无监督分解和LLM验证(详情见补充材料)。首先,我们从IndicCorp[ai4bharat_corpus]提取多样词汇。对于分解,我们将SampoNlp[chelombitko2025samponlp]应用于印度-雅利安语境,利用其**最小描述长度**(Minimum Description Length)原子性评分,同时修改退化约束以适应单字符印度词缀和matra。接下来,Gemini 3.0 Flash[team2023gemini]解决歧义(如Sandhi)并纠正过度分割。这产生了一个包含约560,000个已验证单词的黄金标准词典(表2 https://arxiv.org/html/2608.18087#S3.T2),作为SuTRA的形态探针。至关重要的是,我们采用**双层逻辑**:词典存储纯规范分割,而SuTRA在训练期间将这些映射到**表面边界索引**。我们优先考虑**表面形式完整性**而非规范纯度,以保证零开销的去分词,从而通过简单连接实现精确恢复。 表2:黄金标准统计。 基于规则提取和LLM验证的形态分割的混合体。 ## 4 方法论 参见图注 图2:SuTRA概览。 阶段1(分词前处理)应用正字法规则Φ将每个单词映射为akshara类单元,并使用黄金形态词典或序列到序列模型标记**禁止边界**(合并不应跨越的词素边界)。阶段2(形态感知合并)运行BPE风格算法,评分S(a,b)=f(a,b)Ψ(a,b)γ_t,其中Ψ降低违反禁止边界合并的权重,γ_t控制训练期间的刚性,偏向于尊重印度文字结构和词素边界的合并。图使用PaperBanana[paperbanana]生成。 我们引入SuTRA,一个两阶段框架,将形态先验集成到统计子词学习中(图2 https://arxiv.org/html/2608.18087#S4.F2)。该管道系统地将分词从纯频率驱动转变为形态基础的分割。 **阶段1:分词前处理**。基于MorphTok,此阶段定义原子单元并标记形态敏感边界。标准分词器经常分离从属元音(matra),破坏印度元音附标文字的akshara结构。为了避免这种破坏文字的分割,我们应用正字法规则(Φ)将每个单词w映射到akshara类单元序列U=[u_1,u_2,...,u_n],将修饰符绑定到它们的基础辅音。同时,我们执行形态查找以标记**禁止边界**——与我们黄金词典中词素边界重合的akshara单元之间的边界。对于已知单词使用精选词典,对于未登录项则使用微调的字符级序列到序列模型推断边界。 **阶段2:训练(形态感知合并)**。虽然MorphTok依赖于僵硬的、预先计算的边界强制,SuTRA通过直接将这些形态先验集成到基于评分的Bpe合并过程中而有所不同。SuTRA不采用纯基于频率的合并,而是动态惩罚那些跨越阶段1中识别的禁止边界候选合并。令f(a,b)为候选对(a,b)的语料库频率,χ(a,b)为其**冲突计数**(合并(a,b)跨越禁止边界的发生次数)。形态有效性概率Ψ(a,b)∈[0,1]为: Ψ(a,b)=1−χ(a,b)/f(a,b) 为了控制合并过程,我们引入一个动态**刚性约束**(γ_t)。最终合并评分S(a,b)定义为: S(a,b)=f(a,b)⋅Ψ(a,b)^γ_t 在训练期间,γ_t从γ_start退火到γ_end。这种指数衰减形成一个课程:算法在训练早期严格优先合并安全、连续的词根(高刚性),然后在后期放松约束以附加功能词缀(低刚性)。图3(https://arxiv.org/html/2608.18087#S4.F3)显示,与其他分词器相比,SuTRA的约束转化为更干净的分割,保留了akshara结构和词素边界。详细的算法及复杂性分析见补充材料。 参见图注 图3:分词器形态分割的定性比较。 SuTRA通过尊重语音和形态边界始终匹配黄金标准。 ## 5 实验与结果 为了评估SuTRA的有效性,我们在三种形态丰富的印度语言上进行了实验:印地语(HI)、马拉地语(MR)和古吉拉特语(GU)。我们的评估围绕四个反映我们核心主张的问题展开:(1) SuTRA是否更好地将子词与黄金词素边界对齐?(2) 这些边界是否使整个单词语义更容易从子词嵌入中直接恢复?(3) 由此产生的表示是否在下游机器翻译中产生可测量的提升?(4) SuTRA是否在正字法扰动下保持形态鲁棒性?因此,我们从四个互补的维度评估SuTRA:形态对齐、语义可恢复性、翻译质量和对表面噪声的鲁棒性。 ### 5.1 形态对齐评估 我们首先评估分词器边界是否与印地语(HI)、马拉地语(MR)和古吉拉特语(GU)中的黄金词素分割对齐。 **设置与指标**。我们通过去除子词伪影(如##、_)来标准化分词器输出,以便与黄金词素进行直接字符串匹配。我们报告:(1) **边界F1**——预测与黄金边界指数的精确率和召回率的调和平均;(2) **生育率**——每个黄金片段的平均预测标记数(|T_pred|/|T_gold|)...
相似文章
BHARATI:面向古典印度语言的形态感知分词器与子词丰富度分析
本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。
分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃
本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。
面向字节级BPE的书写系统级分词器适配
本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。
跨语言同形词的标记化
本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。
QuechuaTok:形态边界准确率作为黏着型低资源语言分词器评估的必要指标
本文介绍了QuechuaTok,一个用于评估南克丘亚语分词策略的基准,并引入了形态边界准确率(MorphAcc)作为必要指标。结果表明,BPE实现了低碎片率但形态准确性差,而基于形态感知的PRPE分词器达到了83%的MorphAcc,表明仅凭碎片率不足以评估黏着型语言的分词器。