通过结构相似性提升研究论文序列句子分类的跨语言迁移性能

arXiv cs.CL 论文

摘要

本文探讨通过利用结构相似性来改进研究论文中序列句子分类的跨语言迁移,并基于编码器和生成模型的实验,提出在多语言环境下提升性能的方法。

arXiv:2609.19650v1 Announce Type: new 摘要: 序列句子分类(SSC)是构建科学出版物的重要任务,将SSC研究扩展到英语以外的语言可以提高多语言数字图书馆中科学知识的可访问性。跨语言迁移是解决非英语语言训练数据稀缺的一种有前景的方法。先前在其他自然语言处理任务上的研究表明,捕捉源语言和目标语言之间的语言相似性有益。然而,SSC本质上依赖于话语层面的模式,如标签序列和位置规律性,这些模式无论语言差异如何,在跨语言中都保持一致。为了研究决定SSC迁移成功的因素,我们构建了一个多语言SSC数据集,覆盖了从五个学术数据库收集的13种非英语语言。我们的跨语言迁移实验使用编码器和生成模型表明,语言接近性对迁移性能没有一致的预测力,而修辞结构中的结构相似性在模型之间表现出弱但一致的正相关。在控制源语言性能后,标签分布的相似性是最一致的预测因子。基于这一发现,我们提出了一组三种方法,这些方法显式地利用生成模型的结构信息。在领域内评估中,最佳组合达到了与最强编码器基线相当的性能,而在转移到训练期间未见过的语言时,它超越了最强的编码器基线。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:59

# 通过结构相似性改进研究论文中序列句子分类的跨语言迁移
来源:https://arxiv.org/html/2609.19650
会议:2026年ACM/IEEE数字图书馆联合会议;2026年10月13–16日;美国得克萨斯州弗里斯科  
2026年ACM/IEEE数字图书馆联合会议(JCDL '26),2026年10月13–16日,美国得克萨斯州弗里斯科  
DOI:10.1145/3805696.3846040 (https://doi.org/10.1145/3805696.3846040)  
ISBN:979-8-4007-2597-5/2026/10  
CCS:信息科学 文献表示  
CCS:信息科学 信息抽取  
CCS:信息科学 数字图书馆与档案馆  
© cc  
###### 摘要  
序列句子分类(SSC)是对科学出版物进行结构化的关键任务,将SSC研究扩展到英语以外的语言可以改善多语言数字图书馆对科学知识的访问。跨语言迁移是解决非英语语言训练数据稀缺的一种有前途的方法。先前在其他自然语言处理任务上的研究已经展示了捕获源语言和目标语言之间语言相似性的好处。然而,SSC本质上依赖于话语层面的模式,例如标签序列和位置规律性,这些在不同语言中都是一致的,不受语言差异影响。为了探究决定SSC迁移成功因素,我们构建了一个多语言SSC数据集,涵盖了从五个学术数据库收集的13种非英语语言。我们使用基于编码器和生成模型的跨语言迁移实验表明,语言亲缘关系对迁移性能没有一致的预测能力,而修辞组织方面的结构相似性在不同模型间表现出微弱但一致的正相关。在控制源语言性能后,标签分布的相似性是最一致的预测因子。基于这一发现,我们提出了一组三种方法,利用生成模型显式利用结构信息。在领域内评估中,最佳组合达到了与最强编码器基线相当的水平,在迁移到训练期间未见过的语言时,其性能优于最强的编码器基线。  
###### 关键词:序列句子分类,跨语言迁移,多语言数据集,结构相似性,数字图书馆,学术文献处理  
††cc-license:by  
## 1.引言  
序列句子分类(SSC)是将科学摘要中的每个句子分配给一个修辞角色(如背景、目标、方法、结果或结论)的任务(Dernoncourt and Lee, 2017 (https://arxiv.org/html/2609.19650#bib.bib1))。将摘要分解为这些角色可以实现基于超越关键词匹配的内容检索,例如查找具有相似方法但不同背景的论文。因此,SSC是文献检索、自动摘要和论文推荐等下游应用的基础技术。  
SSC的最新进展利用了基于Transformer模型(Devlin et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib20); Jin and Szolovits, 2018 (https://arxiv.org/html/2609.19650#bib.bib2); Cohan et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib10); Brack et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib3))和大型语言模型(LLMs)(Lan et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib4))构建的层次架构,达到了前所未有的性能水平。然而,这些发展主要集中在英语上,造成了非英语学术研究可访问性方面的差距。  
由多语言预训练语言模型(mPLMs)(Devlin et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib20))促进的跨语言迁移学习已成为弥合这一差距的关键策略。通过将知识从具有丰富标记数据的语言(如英语)迁移到具有很少或没有标记摘要的移语言,它消除了为每种目标语言构建标记数据集的需求。这种迁移的成功长期以来归因于源语言和目标语言之间的语言亲缘关系(Lin et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib6); Philippy et al., 2023 (https://arxiv.org/html/2609.19650#bib.bib5))。然而,最近的研究表明,这种亲缘关系是一个不一致的预测指标(Blaschke et al., 2025 (https://arxiv.org/html/2609.19650#bib.bib7); De Souza et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib34)),并指向特定于任务的因素(Lin et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib8); Yun et al., 2023 (https://arxiv.org/html/2609.19650#bib.bib9))。这促使我们为SSC识别,除了语言距离之外,什么因素决定了跨语言迁移。  
在本研究中,我们专注于SSC的内在结构属性。SSC为每个句子分配一个标签,这些标签形成序列,其顺序和位置在摘要中遵循重复出现的模式;我们将这些模式称为摘要的修辞结构。这部分结构在不同语言中是共享的,因为学术摘要遵循以IMRaD(引言、方法、结果和讨论)为特征的标准化惯例(Sollaci and Pereira, 2004 (https://arxiv.org/html/2609.19650#bib.bib41)),因此背景往往出现在开头,结果往往紧随方法之后。其他部分则因语言而异:例如,在我们的数据中,俄语和中文几乎完全省略背景,直接以目标开头。  
我们量化了两种语言共享这种结构的程度,作为它们的结构相似性,这一衡量标准既捕获了共享惯例,也捕获了特定于单个语言的偏离。为了检验这一特性是否预测迁移,我们构建了一个多语言SSC数据集,涵盖了13种非英语语言,这些语言大约有32,000篇摘要(包括PubMed-RCT的英语部分,共52,487篇)。我们的实证分析表明,由标签分布对齐、标签转换和位置规律性定义的结构相似性,比语言亲缘关系更能一致地预测迁移性能。  
基于这些见解,我们提出了一组三种方法,利用结构信息显式增强跨语言SSC:将结构知识注入提示、使用经过训练的验证器对候选序列进行重排序,以及在零样本设置中强制预测一致性。通过这些方法,我们表明结构信息不仅可以用于预测迁移,还可以直接改进SSC。  
本研究的主要贡献如下:  
- • 我们引入了一个涵盖13种语言的多语言SSC数据集,并通过实证分析表明,结构相似性与跨语言迁移性能的相关性比语言亲缘关系更一致。  
- • 我们提出了一组利用结构信息的方法,与现有基线相比,提高了宏F1分数。  
## 2.相关工作  
### 2.1.序列句子分类  
自从PubMed-RCT基准发布以来(Dernoncourt and Lee, 2017 (https://arxiv.org/html/2609.19650#bib.bib1)),SSC模型已从层次神经架构(Jin and Szolovits, 2018 (https://arxiv.org/html/2609.19650#bib.bib2))发展到基于Transformer的方法(Cohan et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib10))。为了有效捕获序列依赖性和修辞流,现代架构利用层次建模来整合句子级别的表示和文档级别的上下文(Brack et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib3))。层次序列标注网络(HSLN)(Jin and Szolovits, 2018 (https://arxiv.org/html/2609.19650#bib.bib2))就是代表:Bi-LSTM编码每个句子的词元,注意力池化将它们聚合成一个句子向量;第二个Bi-LSTM用邻居的上下文丰富每个句子向量;线性层将结果映射到标签分数;条件随机场(CRF)(Lafferty et al., 2001 (https://arxiv.org/html/2609.19650#bib.bib22))预测具有最高联合概率的标签序列,而不是独立地最大化每个标签。Brack et al. (2024) (https://arxiv.org/html/2609.19650#bib.bib3)用SciBERT(Beltagy et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib40))(一个在科学文本上预训练的编码器)替换了HSLN的词嵌入层,并在四个科学领域评估了生成的模型。最近,基于LLM的方法也显示出有竞争力的性能(Lan et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib4))。然而,现有的SSC研究主要仍集中在英语上。  
CRF学习标签上的转移矩阵,因此诸如方法在结果之前之类的规律性被编码在模型中,而不是留给每个句子的分类器。Brack et al. (2024) (https://arxiv.org/html/2609.19650#bib.bib3)报告说,当来自不同领域的任务使用共同的标签集时,跨任务共享这个输出层会降低性能,并将其归因于每个领域有其自身的标签转移分布。因此,领域之间的差异在于标签序列,而不在于句子本身。我们用相同的术语来比较语言:第4.3节(https://arxiv.org/html/2609.19650#S4.SS3)衡量了两种语言在CRF特征编码的标签分布、转移和位置方面的差异。  
### 2.2.跨语言迁移学习  
零样本跨语言迁移,即模型在源语言上训练并在没有标记示例的目标语言上评估,随着多语言BERT(mBERT)的发布而得到广泛研究(Devlin et al., 2019 (https://arxiv.org/html/2609.19650#bib.bib20)),这是一个在104种语言上预训练的mPLM。据报道,迁移性能与类型相似性(Lauscher et al., 2020 (https://arxiv.org/html/2609.19650#bib.bib11))和词序对齐(Deshpande et al., 2022 (https://arxiv.org/html/2609.19650#bib.bib21))相关。然而,语言亲缘关系是一个不一致的预测指标:其效果因任务而异(Blaschke et al., 2025 (https://arxiv.org/html/2609.19650#bib.bib7)),即使在没有共享文字或语系的情况下也能实现有竞争力的迁移(De Souza et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib34))。另一条研究路线发现,mPLM内部表示的相似性比表面特征更能跟踪迁移(Lin et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib8); Yun et al., 2023 (https://arxiv.org/html/2609.19650#bib.bib9))。这些发现指向特定于任务的因素,这激发了结构化的视角。话语层面的工作提供了一个起点。Zeyrek et al. (2020) (https://arxiv.org/html/2609.19650#bib.bib13)标注了六种语言的平行文本,并报告说即使内容保持不变,话语关系的分布在它们之间也存在差异;Braud et al. (2017) (https://arxiv.org/html/2609.19650#bib.bib12)报告说,在跨语言话语解析中,将文档分割成相关片段的效果相当好,但关系本身则急剧下降,他们部分将其归因于源语料库和目标语料库的关系分布差异。  
对研究文章摘要的比较研究报道了我们所针对体裁中的同类变化:英语摘要倾向于论证工作的意义,而面向当地科学社区的摘要则倾向于报告所做的工作,相应地,哪些修辞角色出现及其频率存在差异(Martín-Martín, 2003 (https://arxiv.org/html/2609.19650#bib.bib37); Van Bonn and Swales, 2007 (https://arxiv.org/html/2609.19650#bib.bib38); Yakhontova, 2002 (https://arxiv.org/html/2609.19650#bib.bib39))。这些都是对小型语料库的手动分析,每个语料库覆盖单一语言对,并且它们没有将记录的变化与自动分类联系起来。由于SSC在修辞角色的序列上运行,这种变化是独立于语言亲缘关系的迁移预测因子候选,并且正是我们测试的那个。  
### 2.3.结构感知方法  
最近的结构感知方法改进了文档建模(Buchmann et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib15))和论证挖掘(Sun et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib16))。研究采用了语法约束解码(Geng et al., 2023 (https://arxiv.org/html/2609.19650#bib.bib17); Park et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib18))和判别重排序(Wang et al., 2024 (https://arxiv.org/html/2609.19650#bib.bib19))来确保输出一致性。鉴于这些发展,我们的研究将验证器-重排序范式(Cobbe et al., 2021 (https://arxiv.org/html/2609.19650#bib.bib14))应用于SSC,使用结构特征在不需要金标准标签的情况下估计候选质量。在这种范式中,模型采样多个候选输出,一个单独训练的验证器对每个进行评分,用候选集中的选择替代单一的贪心解码;验证器在候选及其观测正确性配对上训练,因此在推理时不需要金标准标签。我们对整个候选标签序列进行评分,而不是单个标签。我们不采用语法约束解码,因为我们需要的约束是分布性的而非范畴性的,如第4.4节(https://arxiv.org/html/2609.19650#S4.SS4)所示。  
## 3.多语言SSC数据集  
### 3.1.数据来源与收集  
该数据集由结构化科学摘要构建而成。章节标题无需人工标注即可提供句子标签;由此产生的数据旨在训练应用于没有标题的摘要的模型,在这些摘要中修辞角色无法直接获取。遵循PubMed-RCT 20k(Dernoncourt and Lee, 2017 (https://arxiv.org/html/2609.19650#bib.bib1))的标注方案,我们从章节标题提供修辞标签的非英语摘要构建了一个多语言数据集。PubMed-RCT源自MEDLINE/PubMed基线数据库,未在明确许可证下发布;我们严格将其用于非商业研究,符合美国国家医学图书馆的条款。  
我们基于三个标准选择了五个学术数据库:(1)提供摘要的API访问,(2)包含大量非英语内容,(3)包含带有章节标题的结构化摘要:  
- • DOAJ111https://doaj.org/:多语言开放获取期刊,通过REST API访问。  
- • HAL(Hyper Articles en Ligne)222https://hal.science/:法国国家开放存档,通过OAI-PMH接口访问。  
- • Dialnet333https://dialnet.unirioja.es/:西班牙书目数据库,包含西班牙语和葡萄牙语出版物。  
- • CiNii Research555https://cir.nii.ac.jp/:日本学术数据库,通过REST API访问。  
我们针对13种非英语语言:法语、日语、西班牙语、中文、俄语、葡萄牙语、意大利语、印尼语、土耳其语、韩语、波兰语、荷兰语和爱沙尼亚语。由于结构化摘要通常包含方法和结果部分,我们将这两个术语翻译成每种目标语言,并用作搜索查询。我们仅使用这两个术语,因为几乎所有结构化摘要都包含它们,且它们在这些摘要中的词汇覆盖率极高。

相似文章

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

用于数据高效语言学习的结构先验

arXiv cs.CL

本文研究了从非语言数据进行结构迁移以提高语言建模的数据效率,发现虽然它减少了下一个标记预测损失,但并未可靠地增强下游语言性能。

通过SALT实现跨语言词元表示的改进

arXiv cs.CL

论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。