跨移民路线体验性互文性检测:超越法语叙事的表面相似性

arXiv cs.CL 论文

摘要

本文介绍了体验性互文性检测,使用包括零样本LLM评分在内的无标注方法,以识别来自不同路线的法语移民叙事中共享的体验回声。

arXiv:2607.29188v1 公告类型:新 摘要:穿越地理上不同路线(如跨撒哈拉和巴尔干走廊)的移民,常常讲述出惊人相似的亲身经历:警察暴力、走私者剥削、危险过境和家庭分离。我们引入了体验性互文性检测任务,即在不需要标注训练数据的情况下,自动识别跨移民叙事中共享的体验回声。我们从涵盖这两条走廊的108篇法语移民叙事中自动生成句对,并使用无标注方法进行评分:词汇基线、句子嵌入、基于词性标注的结构特征、移民特定主题词典、上下文感知叙事特征,以及使用Qwen2.5-7B和Mistral-7B在三种提示策略下的零样本LLM评分。我们针对816条专家标注的互文性判断(标注者间Krippendorff's $\alpha = 0.27$)验证了所有方法。结果表明,所有表层、结构和嵌入方法与专家判断的相关性都很弱($r \leq 0.30$);Qwen2.5-7B零样本取得了最佳单一方法相关性($r = 0.38$);少量样本示例降低了Qwen的性能,但显著提升了Mistral;叙事位置显著预测互文性,出发阶段的句对显示出最高的体验回声;结合所有31个特征的监督混合方法达到了$r = 0.45$,比最佳单一方法提高了21%。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:35

# 检测迁移路线中的经验互文性:超越法语叙事中的表面相似性

Sakayo Toadoum Sari\(^1\), Nelly Robin\(^2\), Michelle Auzanneau\(^2\), Lakhdar Sais\(^1\), Véronique Petit\(^2\), Marie Veniard\(^3\), Said Jabbour\(^1\), Fabien Delorme\(^1\)

1CRIL, CNRS – Université d’Artois, France,  
2CEPED, Université Paris Cité, France,  
3EDA, Université Paris Cité, France

1{sakayo,sais,jabbour,delorme}@cril.fr,  
[email protected],  
[email protected],  
[email protected],  
[email protected]

###### 摘要

穿越地理上不同路线(如跨撒哈拉走廊和巴尔干走廊)的移民,往往讲述出惊人相似的亲身经历:警察暴力、走私者剥削、危险穿越和家庭分离。我们引入了**经验互文性检测**任务:自动识别不同移民叙事之间共享的经验呼应,且无需标注训练数据。我们从涵盖两条走廊的108篇法语移民叙事中自动生成句子对,并使用无标注方法对其进行评分:词汇基线、句子嵌入、基于词性的结构特征、移民专属主题词典、上下文感知叙事特征,以及采用三种提示策略的零样本LLM评分(Qwen2.5-7B和Mistral-7B)。我们针对816条专家标注的互文性判断(标注者间Krippendorff's α=0.27)验证了所有方法。结果表明:所有表面、结构和嵌入方法仅与专家判断弱相关(r≤0.30);Qwen2.5-7B零样本取得了最佳单一方法相关性(r=0.38);少样本示例降低了Qwen的性能,但显著提升了Mistral;叙事位置显著预测互文性,出发阶段的句子对表现出最高的经验呼应;结合全部31个特征的监督混合模型达到r=0.45,相比最佳单一方法提升了21%。

## 1 引言

移民是我们这个时代的标志性现象之一,而移民在旅途中产生的叙事,对人文社会科学(HSS)而言,是一笔宝贵但尚未充分开发的知识来源。这些通过沿途中转点访谈收集的叙事,以移民自己的语言捕捉了亲身经历:所面临的危险、所调动的资源,以及塑造每次旅程的复杂决策过程[Robin (2014)](https://arxiv.org/html/2607.29188#bib.bib24);[Bacon (2022)](https://arxiv.org/html/2607.29188#bib.bib2)。HSS研究者反复观察到:遵循完全不同地理路线的移民,往往描述出惊人相似的经历[Robin (2014)](https://arxiv.org/html/2607.29188#bib.bib24);[Bacon (2022)](https://arxiv.org/html/2607.29188#bib.bib2)。一名穿越撒哈拉的科特迪瓦未成年人和一名穿越巴尔干地区的刚果难民,可能都会讲述边境的警察暴力、走私者的剥削、危险的穿越,以及家人分离的痛苦。这种不同叙事虽源自不同地理和文化背景,却呼应共享的经验内容——我们将这一现象称为**经验互文性**,并在本文中引入这一概念,以区别于传统的文学互文性。我们在三个层面上识别经验平行性:(i) **主题**层面,即两个句子描述相同类别的经验(走私者剥削、警察暴力、危险穿越);(ii) **功能**层面,即两者在旅程叙事弧中占据相同角色(出发动机、途中危险、到达);(iii) **语用**层面,即两者承载相同的言语行为或立场(自我离开动机、苦难证言、希望表达)。两个句子可能在这三个层面上完全共享,却不共享任何词汇。与文学研究中涉及作品间文本引用和典故的传统互文性[Kristeva (1969)](https://arxiv.org/html/2607.29188#bib.bib14)不同,经验互文性捕捉的是通过叙事表达的**亲身经历**中的平行性。自动检测这种平行性,对寻求识别移民中普遍模式、理解哪些经历超越特定路线、最终以证据为基础的见解支持政策制定的HSS研究者而言,具有重要价值。先前关于这些叙事的研究[Ing et al. (2025)](https://arxiv.org/html/2607.29188#bib.bib12)侧重于提取领域术语和识别地点,回答了**提及了什么**的问题。我们处理的是互补且更困难的问题:**来自不同路线的两个句子是否描述了同一种经历?** 这需要从实体提取转向经验比较,从针对术语列表的监督评估转向与专家判断的连续相关性。我们将其形式化为一个评分任务。给定来自不同路线叙事的一对句子\(s_{i},s_{j}\),我们寻找一个函数\(f(s_{i},s_{j})\to[0,1]\),在无需标注训练数据的情况下逼近专家评估的经验互文性。[图1](https://arxiv.org/html/2607.29188#S1.F1)展示了我们的方法。我们的贡献如下:我们将经验互文性检测形式化为一个新的NLP任务,并采用无标注流水线;我们针对816条专家判断并用正式的IAA进行验证;我们引入了揭示旅程阶段效应的上下文感知叙事特征。我们的代码已公开。[^1]

[^1]: https://github.com/Toadoum/IntertextMigra

**数据处理**  
**评分方法**  
**评估**

108篇法语叙事(巴尔干 + 跨撒哈拉)  
句子提取 + 分词  
句子对生成(跨路线 + 路线内)  
自动主题标注(15类)  
上下文定位(叙事中的位置)

词汇基线(TF-IDF、Jaccard、BM25、主题词典 — 7个分数)  
词性结构(n-gram、编辑距离、依存三元组、动词框架 — 4个分数)  
上下文感知⋆(位置相似性、阶段匹配、主题密度 — 5个分数)  
句子嵌入(CamemBERT、MiniLM、LaBSE、e5 — 4个分数)  
零样本LLM(Qwen2.5 + Mistral,3种策略 — 6个分数)

每对句子31个分数(无标注)  
816条专家判断(仅验证)  
相关性分析(Pearson r,Spearman ρ)  
混合Ridge(监督上界,r=0.454)

旅程阶段 + 主题分析

**图1:** 流水线概览。左:从原始叙事中自动生成句子对并进行上下文定位。中:五个无标注方法族为每对句子产生31个分数。右:分数针对专家判断进行验证;监督混合模型作为上界。⋆=新方法。

## 2 相关工作

文本挖掘已越来越多地应用于与移民相关的文本,尽管主要是在公共话语层面。Öztürk和Ayvaz (2018) 使用Twitter数据的情绪分析来调查公众对叙利亚难民危机的态度,而Hussain等 (2018) 则利用命名实体提取和定向情绪分析,研究欧洲移民危机期间博客圈叙事的转变。两者均分析公众对移民的**反应**,而我们分析的是**移民自身的叙事**。最接近的工作是Ing等 (2025) 提出的移民叙事语料库文本挖掘框架,其重点是通过改进的集合扩展算法(MultiWidthExpan)进行领域术语提取,以及使用NER和BELA进行地点识别/消歧[Plekhanov et al. (2023)](https://arxiv.org/html/2607.29188#bib.bib19)。其评估使用针对专家术语表的P/R/F1,没有嵌入或LLM基线。我们的工作在相同语料上处理一个根本不同的问题:不是提取提到了哪些实体,而是检测两个句子是否描述了同一种**经历**,通过16种方法与专家互文性分数的连续相关性进行评估。

语义文本相似度(STS)是一个成熟的NLP基准[Cer et al. (2017)](https://arxiv.org/html/2607.29188#bib.bib5);[Agirre et al. (2016)](https://arxiv.org/html/2607.29188#bib.bib1)。现代方法利用预训练Transformer的句子嵌入[Reimers和Gurevych (2019)](https://arxiv.org/html/2607.29188#bib.bib23);[Conneau et al. (2020)](https://arxiv.org/html/2607.29188#bib.bib7),在英语STS基准上取得了强劲表现。然而,经验互文性在根本上不同于语义相似度:两个句子可能在语义上不相似,却在经验上平行。例如,*"On a pris le pickup pour aller à Gao"*("我们坐皮卡去了加奥")和*"On a pris le bus pour aller à Belgrade"*("我们坐大巴去了贝尔格莱德")共享**乘坐公共交通工具前往某城市**这一*经历*,但标准STS模型会因地点和交通工具不同而给出较低分数。相反,共享"police"等关键词的句子可能获得高STS分数,却描述完全不同的经历(常规检查站与暴力遣返)。

话语关系框架如RST[Mann和Thompson (1988)](https://arxiv.org/html/2607.29188#bib.bib15)和PDTB[Prasad et al. (2008)](https://arxiv.org/html/2607.29188#bib.bib20)识别文本片段之间的结构和语义关系。我们的任务不同之处在于,我们比较的是**跨文档**的片段,而非单个文档内部;且我们的关系是经验性的,而非修辞性的。计算叙事分析已通过情感弧[Reagan et al. (2016)](https://arxiv.org/html/2607.29188#bib.bib22)、叙事事件链[Chambers和Jurafsky (2008)](https://arxiv.org/html/2607.29188#bib.bib6)和常识故事理解[Mostafazadeh et al. (2016)](https://arxiv.org/html/2607.29188#bib.bib17)探索了故事相似性。Bamman等 (2013) 从文本中学习叙事图式,而Caselli和Vossen (2017) 提出了以事件为中心的方法。跨文档事件共指[Cybulska和Vossen (2014)](https://arxiv.org/html/2607.29188#bib.bib8)在精神上相近,它跨文档比较"同一类事件",但其目标是事件同一性而非经验平行性。在数字人文领域,定量互文性检测采用文本复用和序列比对来识别文学呼应[Forstall et al. (2015)](https://arxiv.org/html/2607.29188#bib.bib9);我们的工作将该范式从文本典故扩展到经验共鸣。我们增加了一个新维度:识别不同说话者在不同地理情境下的叙事中的经验平行性,其中"事件"是真实的亲身经历。

近期研究表明,LLM能够执行细致的话语任务,包括立场检测、论辩挖掘和语用解释[Gilardi et al. (2023)](https://arxiv.org/html/2607.29188#bib.bib10)。Qwen团队 (2024) 展示了Qwen2.5的强大多语言能力,而Mistral系列[Jiang et al. (2023)](https://arxiv.org/html/2607.29188#bib.bib13)则以其高效架构展现了有竞争力的性能。我们在一种新颖的无标注环境中评估这两个家族,揭示了它们在处理经验比较时的显著差异。

## 3 数据

我们的语料库包含108篇法语移民叙事,通过两条走廊沿途中转点的半结构化访谈收集:

- **跨撒哈拉走廊**(99篇叙事):在尼日尔(阿加德兹、阿尔利特)、阿尔及利亚(阿德拉尔、塔曼拉塞特、马格尼亚)、塞内加尔(达喀尔、姆布尔、齐金绍尔)和摩洛哥(乌季达、拉巴特)从撒哈拉以南未成年人中收集。来源国:科特迪瓦、马里、刚果民主共和国、几内亚、塞内加尔、尼日利亚、冈比亚、布基纳法索。
- **巴尔干走廊**(9篇叙事):沿塞尔维亚、北马其顿和波斯尼亚的过境路线,从来自刚果(布拉柴维尔)、阿尔及利亚、几内亚、科特迪瓦、索马里、马里和塞内加尔的移民中收集。

[表1](https://arxiv.org/html/2607.29188#S3.T1)报告了语料库统计。叙事平均876词,跨撒哈拉叙事较短(平均787词),因为未成年人年龄较小;巴尔干叙事则明显更长(平均1,672词),反映了更复杂的多国旅程。语料库由训练有素的研究人员和当地协会在ANR HYCI项目[Robin (2014)](https://arxiv.org/html/2607.29188#bib.bib24)及相关田野调查中于2015年至2022年间收集,并首次由Ing等 (2025) 用于计算分析。访谈以法语或当地语言进行,并转写为法语。通过时间和匿名保证建立了信任关系。由于数据的敏感性,我们不公开数据(§伦理考虑)。

**表1:** 按走廊划分的语料库统计。国家 = 移民来源国。

为说明数据性质,考虑以下来自不同走廊的两个片段,它们描述了平行的走私者剥削经历:

> 跨撒哈拉:"J'ai payé 75.000 FCFA pour passer en Algérie. J'ai emprunté le pickup avec une dizaine de migrants. On était très serré dans le pickup."(*我付了75,000西非法郎进入阿尔及利亚。我和大约十个移民一起搭了皮卡。我们在皮卡里非常拥挤。*)

> 巴尔干:"Il m'avait vendu un passeport congolais avec un visa de la Turquie à l'intérieur [...] quand je suis arrivé en Turquie, ils m'ont dit 'Monsieur ce n'est pas bon', et ils m'ont refoulé."(*他卖给我一本刚果护照,里面有土耳其签证 [...] 当我到达土耳其时,他们对我说"先生,这个不行",然后把我遣返了。*)

两者都描述了剥削——经济上和法律文件上——却几乎不共享任何词汇。这正是我们任务所面临的挑战。

从叙事中,我们自动提取句子,并采用分层抽样在三种配置下生成句子对:跨路线(一个巴尔干,一个跨撒哈拉)、巴尔干内部和跨撒哈拉内部。每对句子通过关键词匹配自动分配主题标签,词典包含15个专家定义类别,包括*violence_police*、*passeur_exploitation*、*traversée_dangereuse*、*solidarité*、*famille_séparation*、*exploitation_travail*、*document_fraude*、*détention_camp*、*motivation_départ*、*mineur_seul*、*rêve_football*、*discrimination_racisme*、*mort_danger_vital*、*attente_stagnation*和*autre*。句子对生成不涉及人工标注。816对句子的分层样本由两位HSS移民专家在0.0(无经验联系)到1.0(几乎相同经历)的连续尺度上进行标注。其中283对获得独立双标注,产生中等一致性(表2)。

相似文章

移民之声与地方新闻:弥合社区需求与媒体内容差距的洞察

arXiv cs.CL

# 弥合社区需求与媒体内容差距的洞察 来源:[https://arxiv.org/html/2604.16651](https://arxiv.org/html/2604.16651) ## 移民之声与地方新闻:弥合社区需求与媒体内容差距的洞察 作者:Paula Dolores Rescala [paula\.rescala@epfl\.ch](https://arxiv.org/html/2604.16651v1/mailto:[email protected]),EPFL 瑞士 Victor Bros [vbros@idiap\.ch](https://arxiv.org/html/2604.16651v1/mailto:[email protected]),Idiap Research Institute 及 EPFL 瑞士 与 Daniel Gatica