SuTRA:结构统一的词元化与根词意识

arXiv cs.CL 论文

摘要

SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。

arXiv:2608.18087v1 公告类型:新 摘要:现有的子词分词器优化统计压缩,但忽略了形态结构,尤其是词根与词缀之间的关系。这对形态丰富的印度语言是有害的,因为其基本单位是复杂的正字音节(aksharas)而非字母。基于频率的方法过度分割词汇,任意拆分词根和词缀——我们将这种现象称为形态破碎。我们提出了SuTRA(结构统一的词元化与根词意识),这是一种形态感知算法,保留akshara的不可分割性,并惩罚跨越形态边界的合并。我们还发布了针对印地语、马拉地语和古吉拉特语的新形态分割数据集。SuTRA减少了破碎现象,在形态对齐(边界F1)上实现了+14.7%的峰值增益,在语义可恢复性(印地语)上实现了+34%的提升,相较于BPE。这些结构增益在机器翻译中平均带来了+8.08 chrF2的改进。
查看原文
查看缓存全文

缓存时间: 2026/08/20 09:52

# SuTRA:具有根感知能力的结构统一分词方法  
来源:https://arxiv.org/html/2608.18087  
Rathore Gole Telwadkar Bhatia Ruparel Surekha Bhargava  
Motilal Oswal Financial Services Ltd. 印度  
印度理工学院(IIT)孟买分校 印度  

###### 摘要  
现有的子词分词器通过统计压缩进行优化,但忽略了形态结构,尤其是词根与词缀之间的关系。这对于形态丰富的印地语言尤为有害,因为这些语言的基本单位是复杂的正字音节(akshara)而非字母。基于频率的方法过度分割单词,任意拆分词根和词缀——这一现象我们称为**形态破碎**。我们提出SuTRA111项目页面:https://mo-vaibhavr-43300.github.io/SuTRA/(具有根感知能力的结构统一分词),这是一种形态感知算法,能够保留akshara的不可分割性,并对跨越形态边界的合并进行惩罚。同时我们发布了针对印地语、马拉地语和古吉拉特语的新形态分割数据集。SuTRA减少了形态破碎,在形态对齐(边界F1)上获得+14.7%的峰值提升,在语义可恢复性(印地语)上较Bpe提升+34%。这些结构性改进在机器翻译中平均带来了+8.08 chrF2的提升。  

###### 关键词:  
大型语言模型、分词、形态完整性、印地语言  

## 1 引言  
现代NLP流程依赖分词器作为解决输入-表示鸿沟的基础桥梁,将原始文本转换为填充语言模型高维向量空间的离散标记[pennington2014glove, mikolov2013distributed, sarzynska2021detecting]。当前的事实标准——如字节对编码(Bpe)[Gage1994-ds, Sennrich2016-uh]、WordPiece[Schuster2012-ev]和Unigram[Kudo2018-ue]——主要作为统计数据压缩技术。虽然它们能有效缩短序列长度并降低未登录词(OOV)率,但根本上对语言的形态结构保持“无知”[Hofmann2022-td, Hofmann2020-lg]。尽管出现了无分词架构的探索[deiseroth2024t, clark2022canine, xue2022byt5, tay2021charformer],最先进的模型[brown2020language, guo2025deepseek, yang2025qwen3, team2025gemma]仍依赖Bpe式分割并继承了其结构局限。  

由于这些分词器忽略形态规则,它们常将多词素单词分割为与词根和词缀错位的子标记。我们将这种分词器层面的错位称为**形态破碎**(图1 https://arxiv.org/html/2608.18087#S1.F1)。在形态丰富的语言中,尤其是在天城文等印地文字书写的语言中,这一问题被放大。这些文字属于元音附标文字:基础辅音和从属元音(matra)共同构成作为原子书写单位的正字音节(akshara)[akshara_ref]。现成分词器经常在这些单位内部进行分割——例如将matra与其基础辅音分离。许多印度-雅利安语言还表现出**连音变化**(Sandhi),即在词和词素边界处的语音片段会发生改变或融合[sandhan2022translist, gaikwad2021state],这进一步模糊了底层的词素边界。加上有充分记录的**印度税**(Indic Tax)现象——即更高的标记生育率(每个单词更多标记)[kumar2026sanskrit, pattnayak2025tokenization, tamang2024evaluating, chaudhari2023significance]——这些特性导致了更严重的形态破碎。我们使用**语义盲**(Semantic Blindness)来描述相应的表示层面影响:词根语义更难通过简单线性探针恢复,嵌入对未改变底层词素的小正字法变化变得过度敏感[asgari2025morphbpe, arnett2025evaluating, morphtok2024, isac2025slip]。  

参见图注 图1:形态破碎与词根保留对比。  
对于印地词“asādhāraṇ”,标准Bpe将否定前缀与词根融合([asā]+[dhāraṇ]),而SuTRA清晰地分离了前缀和词根([a]+[sādhāraṇ])。我们称这种频率驱动的前缀-词根融合为**形态破碎**;SuTRA的词根保留分割产生了更稳定的子词单元并减少了语义盲。图使用PaperBanana[paperbanana]生成。  

为了解决复杂语言中的形态破碎及其语义影响,我们做出三项贡献:  
- • **SuTRA(具有根感知能力的结构统一分词)**:我们引入了Bpe的结构引导扩展,通过轻量级语言学先验增强基于频率的合并。它结合了对akshara类单元的脚本感知分组、形态对齐的合并评分和词根保留的边界约束,以惩罚跨有效形态单位的分割。  
- • **印度语形态黄金标准数据集**:我们构建了大规模、LLM辅助的形态分割数据集,专为三种印度语言(印地语、马拉地语和古吉拉特语)量身定制,为评估形态对齐提供了稳健的通用基准。  
- • **内在和下游评估**:我们设计了一套全面的评估套件,涵盖形态对齐、语义可恢复性、正字法扰动下的鲁棒性和机器翻译。在这四个维度上,SuTRA减少了形态破碎并产生了更稳定、结构对齐的表示:它更好地尊重词素边界而没有任意过度分割,与标准基线相比提高了内在语义可恢复性和下游质量。  

## 2 相关工作  
### 2.1 频率驱动的分词  
标准词汇构建依赖于压缩算法,如Bpe[Gage1994-ds, Sennrich2016-uh]、WordPiece[Schuster2012-ev]、Unigram[Kudo2018-ue]和SuperBpe[liu2025superbpespacetravellanguage]。通过将文本视为与语言无关的字符流,这些方法最大化统计覆盖率,但经常覆盖语言边界,系统性地引发形态破碎[Banerjee2018-hd, Hofmann2020-lg]。先前的缓解措施,如随机正则化(Bpe-Dropout[provilkov-etal-2020-bpe])或事后重新对齐(Flota[hofmann-etal-2022-embarrassingly]),仍然是辅助干预,未能纠正初始词汇创建时根深蒂固的结构分离。此外,标准评估指标如压缩比和困惑度[haga2025babylmchallengeexploringeffect, ali2024tokenizer]掩盖了这些表示低效性,因为它们测量序列可预测性而非子词完整性。  

### 2.2 字符级和无标记架构  
为了绕过子词词汇的局限,一些工作提出了无分词或字符级架构,如Canine[clark2022canine]、ByT5[xue2022byt5]和Charformer[tay2021charformer]。这些模型直接处理原始字节或字符,理论上通过允许模型学习自身的形态内部表示来完全避免“破碎”问题[deiseroth2024t]。然而,这些架构遭受显著的**计算惩罚**,因为字符级处理大幅增加了序列长度,使其在长上下文任务中计算成本高昂。因此,最先进的模型继续使用基于子词的Bpe[guo2025deepseek, yang2025qwen3, team2025gemma],在继承其结构局限性的同时受益于其效率。  

### 2.3 印地LLM中的形态挑战  
**形态丰富语言**(Mrls),特别是**印度语族**中的语言,遭受不成比例的**印度税**,表现为高生育率和语义锚定不良[morphtok2024, Lian2025-ch]。传统Bpe未能捕捉**连音变化**(Sandhi,语音融合),并且经常通过将**matra**(从属元音)与基础辅音解耦来违反**元音附标文字**(Abugida)的完整性[Banerjee2018-hd]。先前的工作探索了形态感知分词和注意力引导的分割[morphtok2024, asgari2025morphbpe, jabbar2024morphpiecelinguistictokenizer],但要么将形态视为分词前启发式方法,要么针对特定语言(英语、希伯来语、土耳其语)而非印度元音附标文字[jabbar2024morphpiecelinguistictokenizer, seker-etal-2022-alephbert, Toraman_2023]。虽然像Ag-Bpe[charlet_2025_agbpe_v3]这样的当代方法通过注意力引导评分瞄准语义感知,但它未能明确保留印度文字的原子边界。相比之下,我们的方法通过惩罚驱动的形态违规来处理,这表现出对保留标记级语义连贯性的更高敏感性。  

## 3 形态数据集准备  
对于MRL子词分词的一个关键瓶颈是缺乏经过验证的黄金标准分割。大规模资源如Unimorph 4.0[batsuren2022unimorph40universalmorphology]和MorphyNet[batsuren-etal-2021-morphynet]主要是**范式中心**的——将词元映射到屈折形式,而没有定义明确的边界。同样,特定数据集如GujMORPH[baxi-bhatt-2022-gujmorph]依赖基于规则的词干提取,未能恢复斜格词根或处理语音融合(Sandhi)。为了解决这个问题,我们为印地语、马拉地语和古吉拉特语构建了**黄金标准形态分割数据集**。如表1所示(https://arxiv.org/html/2608.18087#S3.T1),我们的数据集通过LLM循环管道强制执行**词根恢复**(例如,将斜格“ghara”映射到词根“ghar”)。  

表1:形态数据集。  
我们首次提供了针对印度文字的高规模、LLM验证的形态覆盖。  

### 3.1 数据集管道  
我们采用三阶段混合管道——语料库提取、无监督分解和LLM验证(详情见补充材料)。首先,我们从IndicCorp[ai4bharat_corpus]提取多样词汇。对于分解,我们将SampoNlp[chelombitko2025samponlp]应用于印度-雅利安语境,利用其**最小描述长度**(Minimum Description Length)原子性评分,同时修改退化约束以适应单字符印度词缀和matra。接下来,Gemini 3.0 Flash[team2023gemini]解决歧义(如Sandhi)并纠正过度分割。这产生了一个包含约560,000个已验证单词的黄金标准词典(表2 https://arxiv.org/html/2608.18087#S3.T2),作为SuTRA的形态探针。至关重要的是,我们采用**双层逻辑**:词典存储纯规范分割,而SuTRA在训练期间将这些映射到**表面边界索引**。我们优先考虑**表面形式完整性**而非规范纯度,以保证零开销的去分词,从而通过简单连接实现精确恢复。  

表2:黄金标准统计。  
基于规则提取和LLM验证的形态分割的混合体。  

## 4 方法论  
参见图注 图2:SuTRA概览。  
阶段1(分词前处理)应用正字法规则Φ将每个单词映射为akshara类单元,并使用黄金形态词典或序列到序列模型标记**禁止边界**(合并不应跨越的词素边界)。阶段2(形态感知合并)运行BPE风格算法,评分S(a,b)=f(a,b)Ψ(a,b)γ_t,其中Ψ降低违反禁止边界合并的权重,γ_t控制训练期间的刚性,偏向于尊重印度文字结构和词素边界的合并。图使用PaperBanana[paperbanana]生成。  

我们引入SuTRA,一个两阶段框架,将形态先验集成到统计子词学习中(图2 https://arxiv.org/html/2608.18087#S4.F2)。该管道系统地将分词从纯频率驱动转变为形态基础的分割。  

**阶段1:分词前处理**。基于MorphTok,此阶段定义原子单元并标记形态敏感边界。标准分词器经常分离从属元音(matra),破坏印度元音附标文字的akshara结构。为了避免这种破坏文字的分割,我们应用正字法规则(Φ)将每个单词w映射到akshara类单元序列U=[u_1,u_2,...,u_n],将修饰符绑定到它们的基础辅音。同时,我们执行形态查找以标记**禁止边界**——与我们黄金词典中词素边界重合的akshara单元之间的边界。对于已知单词使用精选词典,对于未登录项则使用微调的字符级序列到序列模型推断边界。  

**阶段2:训练(形态感知合并)**。虽然MorphTok依赖于僵硬的、预先计算的边界强制,SuTRA通过直接将这些形态先验集成到基于评分的Bpe合并过程中而有所不同。SuTRA不采用纯基于频率的合并,而是动态惩罚那些跨越阶段1中识别的禁止边界候选合并。令f(a,b)为候选对(a,b)的语料库频率,χ(a,b)为其**冲突计数**(合并(a,b)跨越禁止边界的发生次数)。形态有效性概率Ψ(a,b)∈[0,1]为:  
Ψ(a,b)=1−χ(a,b)/f(a,b)  
为了控制合并过程,我们引入一个动态**刚性约束**(γ_t)。最终合并评分S(a,b)定义为:  
S(a,b)=f(a,b)⋅Ψ(a,b)^γ_t  
在训练期间,γ_t从γ_start退火到γ_end。这种指数衰减形成一个课程:算法在训练早期严格优先合并安全、连续的词根(高刚性),然后在后期放松约束以附加功能词缀(低刚性)。图3(https://arxiv.org/html/2608.18087#S4.F3)显示,与其他分词器相比,SuTRA的约束转化为更干净的分割,保留了akshara结构和词素边界。详细的算法及复杂性分析见补充材料。  

参见图注 图3:分词器形态分割的定性比较。  
SuTRA通过尊重语音和形态边界始终匹配黄金标准。  

## 5 实验与结果  
为了评估SuTRA的有效性,我们在三种形态丰富的印度语言上进行了实验:印地语(HI)、马拉地语(MR)和古吉拉特语(GU)。我们的评估围绕四个反映我们核心主张的问题展开:(1) SuTRA是否更好地将子词与黄金词素边界对齐?(2) 这些边界是否使整个单词语义更容易从子词嵌入中直接恢复?(3) 由此产生的表示是否在下游机器翻译中产生可测量的提升?(4) SuTRA是否在正字法扰动下保持形态鲁棒性?因此,我们从四个互补的维度评估SuTRA:形态对齐、语义可恢复性、翻译质量和对表面噪声的鲁棒性。  

### 5.1 形态对齐评估  
我们首先评估分词器边界是否与印地语(HI)、马拉地语(MR)和古吉拉特语(GU)中的黄金词素分割对齐。  

**设置与指标**。我们通过去除子词伪影(如##、_)来标准化分词器输出,以便与黄金词素进行直接字符串匹配。我们报告:(1) **边界F1**——预测与黄金边界指数的精确率和召回率的调和平均;(2) **生育率**——每个黄金片段的平均预测标记数(|T_pred|/|T_gold|)...

相似文章

分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

arXiv cs.CL

本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。

面向字节级BPE的书写系统级分词器适配

arXiv cs.CL

本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。

跨语言同形词的标记化

arXiv cs.CL

本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。