Observatorio Lázaro:西班牙新闻界英语借词使用的自填充数据库

arXiv cs.CL 论文

摘要

本文介绍了 Observatorio Lázaro,这是一个持续更新的数据库和公共网络/API 资源,利用神经序列标注模型监测西班牙数字新闻中的英语借词使用情况,记录了 2020 年至 2026 年间超过两百万条借词。

arXiv:2608.00713v1 公告类型:新 摘要:本文介绍了 Observatorio Lázaro,这是一种语言资源,用于监测西班牙数字新闻中未同化的词汇借词(主要是英语词汇借词或英语借词)。自 2020 年 4 月以来,该系统自动处理一批新闻媒体的每日输出,使用神经序列标注模型检测借词,并通过公共网页界面和 API 提供结果。最终形成了一个持续更新的历时数据库,在撰写本文时,该数据库记录了超过两百万条借词,涵盖 1.88 万篇文章和 9.93 亿个运行词元(2020-2026 年)。本文对该资源进行了说明:我们描述了端到端流水线(采集、检测、后处理、存储和访问)、数据模型和可用性条款;我们通过检测器的留出集性能(借词类别的跨度级 F1=0.86)、训练语料库上的标注者间一致性(Cohen's kappa=0.91)以及对部署数据中 1,000 个跨度的手动精确度审计来评估该资源;并将其置于西班牙语借词词典编纂、带标注借词语料库和新词监测观察站的背景下。数据显示,未同化的英语借词在西班牙新闻中的使用频率约为每千个词元两个英语借词,且该频率保持稳定。我们历时六年的统计分析表明,西班牙语中的英语借词词汇表现出一个开放且不断增长的类别,其中 58.7% 的型(type)仅出现一次(在根据检测精确度校正后为 53.6%),其密度在时尚、科技和生活方式板块最高,在政治和机构新闻中最低。该资源旨在通过提供西班牙新闻中借词的持续更新记录,来补充静态借词词典和一次性标注语料库。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:44

# Observatorio Lázaro:西班牙新闻媒体中英语借词使用的自动填充数据库

来源:https://arxiv.org/html/2608.00713

\[1\]\\fnmElena\\surÁlvarez-Mellado

1\]\\orgdiv语言学系,\\orgname马德里自治大学,\\orgaddress\\country西班牙

###### 摘要

本文介绍了 Observatorio Lázaro,一个监测西班牙数字新闻媒体中未同化词汇借用(主要是英语词汇借用,即*英语借词*)的语言资源。自 2020 年 4 月以来,该系统自动处理一组新闻媒体的每日输出,使用神经序列标注模型检测借用词,并通过公开网页界面和 API 提供结果。其成果是一个持续更新的历时数据库,截至撰写本文时,该数据库记录了 1.88 亿篇文章中超过两百万个借用词,涵盖 9.934 亿个运行词元(2020–2026 年)。本文对该资源进行了说明:我们描述了端到端流水线(采集、检测、后处理、存储和访问)、数据模型和可用性条款;我们通过检测器在保留集上的性能(借用类别的跨度级 F1 = 0.86)、训练语料上的标注者间一致性(Cohen’s κ = 0.91)以及对已部署数据中 1,000 个跨度的人工精确率审计来评估该资源;并将其置于西班牙借用词词典编纂、标注借用语料库以及其他语言中的新词监测观察站等相关工作之中。数据显示,未同化的英语借词在西班牙新闻媒体中的使用频率约为每千词两个英语借词,且该比率保持稳定。我们为期六年的统计分析表明,西班牙语中的英语借词词汇表现为一个开放且不断增长的类别,其中 58.7% 的词型仅出现一次(在根据检测精确率校正后为 53.6%),其密度在时尚、科技和生活方式板块中最高,在政治和机构新闻中最低。该资源旨在通过提供西班牙新闻媒体中借用词的持续更新记录,补充静态借用词典和一次性标注语料库。

###### 关键词:

英语借词、词汇借用、语言资源、历时语料库、新词监测、西班牙语

## 1 引言

多语制和语言接触在历史上一直是常态而非例外。正如thomason\_sarah\_g\_social\_2003所言,“所有语言在弱意义上都是混合的:没有任何自然人类语言完全缺乏外来成分”。语言接触实际上是语言变化的主要诱因之一:说话者将属于一种语言的模式并入另一种语言,这一过程被称为语言借用\[haugen\_analysis\_1950,weinreich\_languages\_1963\]。当所转移的内容属于词汇层面时,我们称之为*词汇借用*。

词汇借用是一个特别有价值的研究对象,因为它处于社会层面与系统层面的交汇点。一个词可能随着某种器物或技术一同被引入,从而记录社区之间的文化交流;也可能因为外来形式被认为比本族形式更具声望而被引入,从而反映出塑造语言使用的社会等级。因此,借用是语言之间接触以及使用这些语言的社区之间社会动态的证据\[zenner\_cognitive\_2012\]。与此同时,哪些词会被借用、它们获得何种地位、以及它们多大程度上被适应于接受语言,揭示了该语言中运作的语法模式和说话者预期,以及语言变化的一般约束\[van1994modeling,haspelmath\_ii\_2009\]。

英语词汇被借用进入其他语言(如influencer、streaming、podcast和look等词)是这一过程在当代欧洲语言中最显著的实例\[furiassi\_anglicization\_2012\]。据估计,法国新闻读者大约每千词就会遇到一个新的词汇借用,其中英语借用词的数量超过所有其他来源语言的总和\[chesley\_predicting\_2010,chesley\_lexical\_2010\]。西班牙语也不例外\[nunez\_nogueroles\_up--date\_2017\]:在智利新闻媒体中,借用词约占新词(neologisms)的 30%,其中 80% 是英语借词\[gerding\_anglicism\_2014\];就欧洲西班牙语而言,据估计 1991 年英语借词约占《国家报》(El País)所用词汇的 2%\[rodriguez\_gonzalez\_spanish\_2002\],这一数字如今很可能要高得多,但迄今尚无任何持续更新的测量能够予以确认。

现有关于词汇借用普遍程度的估计稀少、过时且难以比较,因为对这一现象进行实证研究历来困难重重。词典编纂传统对借用词进行了权威但静态的记录,且存在数年的滞后\[pratt1980,lorenzo1996,rodriguezlillo1997,rodriguez2017\]。基于语料库的研究捕捉的是共时切片,而且关键在于依赖于对通用参考语料库的人工检查,这迫使研究者要么手工标注整个语料库,要么将查询限制在预定义的词项列表中(第2.3节 (https://arxiv.org/html/2608.00713#S2.SS3))。这两种策略都无法扩展到持续进行的过程:借用词是出了名的易变\[poplack2017borrowing\],而且由于它们也是稀疏现象,穷尽式词表需要非常大的语料库,而这没有自动化是不可能实现的。

近年来出现了一波关于借用检测的计算研究,产生了标注数据集和模型\[alvarezmellado2020headlines,adobo2021,alvarezmellado2022,ahmadi2025conloan\],但并未形成一个对现象实时展开的持续观察。一直缺乏的是这样一种资源,它兼具四个特性:大规模、历时深度、开放可用和持续更新,也就是一份持续记录哪些英语形式进入西班牙新闻媒体、何时、何地以及以何种频率进入的长期记录。

在本文中,我们介绍 Observatorio Lázaro\[alvarezmellado2020obs\](网址:https://observatoriolazaro.es/),这是一个自动监测系统,自 2020 年 4 月以来每天检索一组西班牙新闻媒体发布的文章,使用神经序列标注模型检测其中包含的未同化借用词,并通过公共网站和 API 发布结果数据。其副产品是一个累积的历时数据库,截至 2026 年 7 月,该数据库记录了 1,880,377 篇文章中的 2,007,647 个借用词元,涵盖 9.934 亿个运行词元。

该资源的目标是使英语借词使用的分析能够在真实语境中、大规模、系统化且以数据驱动的方式进行,从而同时支持词典编纂工作和语料库语言学研究。检测模型及其训练所用的标注语料库已在先前工作中介绍\[alvarezmellado2022\];本文的贡献在于可运行的监测系统以及在该模型基础上构建的历时资源:其流水线、数据模型、可用性和再利用条款、作为资源的评估,以及对六年持续监测所揭示内容的初步刻画,包括上述估计无法提供的英语借词密度测量。

有必要明确说明本文相较于其所依托的先前工作增加了什么。alvarezmellado2022引入了coalascorpus(CoalAS 语料库)以及一组在其上训练的模型,并在保留的标注文本上对这些模型进行了评估;那篇论文讨论的是标注数据集和建模任务。本文两者都不是。本文的对象是自 2020 年以来一直在生产环境中运行该模型的系统,以及六年运行所产生的数据库:采集和预处理流水线、数据模型和访问层(第3节 (https://arxiv.org/html/2608.00713#S3));数据可被再利用的条件(第4.3节 (https://arxiv.org/html/2608.00713#S4.SS3));对检测器应用于未经过滤的新闻电讯而非经过整理的测试文本时表现的评估——这一结果与基准数值有显著差异(第5.3节 (https://arxiv.org/html/2608.00713#S5.SS3));以及对累积输出的刻画(第6节 (https://arxiv.org/html/2608.00713#S6))。这些内容均未出现在先前工作中,尤其是已部署评估,只有在系统运行足够长的时间以产生值得审计的数据库之后才能进行。模型和标注语料库是此类资源的输入;它们本身并不是资源。

本文组织如下。第2节 (https://arxiv.org/html/2608.00713#S2)界定了资源所跟踪的现象,回顾了关于西班牙语中英语借词的描述性、基于语料库和计算方面的文献,并将 Lázaro 定位在可比资源之中。第3节 (https://arxiv.org/html/2608.00713#S3)记录了端到端流水线。第4节 (https://arxiv.org/html/2608.00713#S4)描述了由此产生的数据库:其数据模型、规模、覆盖范围以及可用性和许可。第5节 (https://arxiv.org/html/2608.00713#S5)从三个维度评估该资源:模型性能、标注可靠性以及已部署数据的人工精确率审计。第6节 (https://arxiv.org/html/2608.00713#S6)对 2020–2026 年的资源进行统计刻画。第7节 (https://arxiv.org/html/2608.00713#S7)讨论应用和再利用;第8节 (https://arxiv.org/html/2608.00713#S8)说明局限性。

## 2 背景与相关资源

### 2.1 词汇借用:现象的范围

语言借用是指将另一种语言中的元素和模式在一种语言中再现的过程\[haugen\_analysis\_1950\],并已在接触语言学中得到广泛研究\[weinreich\_languages\_1963\]。学界已提出了若干类型学框架,以根据所涉及的语言层面以及借用元素的整合程度来刻画借用\[thomason\_language\_1992,matras\_grammatical\_2007,haspelmath\_loanwords\_2009\]。词汇借用尤其涉及单一词汇单位的并入,通常伴随形态和音系上的改造以符合接受语言的模式\[poplack\_social\_1988,onysko\_anglicisms\_2007\]。例如,在西班牙语中,借入动词必须加上后缀-ar或-ear才能进入动词范式(如tuitear,来自to tweet),而音系适应可能体现在拼写中,因此未适应的spoiler与适应后的espóiler并存。

所有这些音系、正字法和形态上的转变都可能使借用词最终完全同化进入接受语言的词汇,从而使母语者失去将该词视为“外来”的感知\[lipski\_code-switching\_2005\]。一些作者认为,借用词需要被母语者认定为外来词才能被视为借用\[zenner\_cognitive\_2012\]。例如,像bar这样的词最初是从英语借入西班牙语的,但它已被高度同化,如今西班牙语单语者将其视为本族词,其英语本质仅被视为词源学上的事实。另一方面,像whisky这样的词(在西班牙语中也被使用了相当长一段时间)从未被完全同化,并且被视为外来词。

在本文中,我们处理的是西班牙语中未同化的词汇借用,即从其他语言并入西班牙语但尚未经历同化过程的词。我们重点关注来自英语的词汇借用(也称英语借词),因为它们代表了当前西班牙语借用词的绝大多数。

另一个界限是借用与语码转换(codeswitching)之间的界限;语码转换是双语社区话语中两种或多种语言之间的交替\[poplack\_sometimes\_1980\]。与借用不同,语码转换按其定义不融入接受语言,也不会引起其词汇的变化;正如haspelmath\_ii\_2009所言,语码转换“不是一种接触引发的语言变化,而是一种接触引发的言语行为”。然而,一个清晰的区分仍然难以实现,特别是对于出现在原本单语语境中的未整合外来项(所谓的“孤立外来语项”)。一些作者将借用和语码转换视为一个边界模糊的连续体\[clyne\_dynamics\_2003\],而poplack\_myths\_2012则认为它们是不同的现象,且整合是突变的而非渐变的\[poplack\_borrowing\_1984,poplack\_social\_1988\]。被提出的区分标准包括频率\[stammers\_testing\_2012\]、整合程度\[poplack\_borrowing\_1984\]、长度\[calude\_modelling\_2020\]、说话者双语能力\[pfaff\_constraints\_1979\]以及词库收录性\[treffers-daller\_simple\_2023\];这一争论尚未解决\[lipski\_code-switching\_2005\],因此一些作者倾向于使用不可知论术语,如“来源语言项”\[deuchar\_english-origin\_2016\]或语码混合(code-mixing)\[muysken\_bilingual\_2000\]。正如poplack\_myths\_2012所言,“区分语码转换和借用是当今接触语言学领域最棘手的问题”。

为本研究之目的,我们遵循poplack\_myths\_2012所采用的方法,将语码转换和借用视为两种不同的现象。我们认为语码转换是流畅的多词干扰,通常符合两种语言的语法限制,并且由双语说话者在双语话语中(通常是口语中)产生;而我们将词汇借用定义为外源词,由不懂来源语言的单语个体使用。

### 2.2 西班牙语中的英语借词

英语对西班牙语的影响数十年来一直是语言学研究的持续议题\[pratt1980,furiassi\_anglicization\_2012,nunez\_nogueroles\_up--date\_2017\]。先前研究提出了不同的框架来分析和分类西班牙语中英语借词的使用\[lorenzo1996,medina\_lopez\_anglicismo\_1998,rodriguez\_gonzalez\_anglicisms\_1999,nunez\_nogueroles\_comprehensive\_2018\],并考察了正字法整合\[nunez\_nogueroles\_typographical\_2017\]、历时变迁\[gimeno\_menendez\_desplazamiento\_2003\]、类型学特征\[gomez\_capuz\_towards\_1997\]、句法英语借词\[rodriguez\_medina\_anglicismos\_2002\]、社会文化维度\[gomez\_capuz\_prestamos\_2004\]以及词典编纂覆盖\[balteiro\_reassessment\_2011\]。这一传统在《新英语借词词典》(Nuevo diccionario de anglicismos)\[rodriguezlillo1997\]和《英语借词大词典》(Gran diccionario de anglicismos)\[rodriguez2017\]等参考著作中得以结晶。尽管这些著作具有权威性,但它们是静态的:它们描述的是某个时间点上的精选词目,无法跟踪频率、扩散或活生生的新闻媒体所产生的大量短暂借用词的不断更替。

### 2.3 基于语料库研究英语借词的局限性

关于西班牙语中英语借词使用的实证研究主要依赖语料库语言学\[rodriguez\_medina\_anglicismos\_2002,gimeno\_menendez\_desplazamiento\_2003,balteiro\_reassessment\_2011,nunez\_nogueroles\_corpus-based\_2018\],要么依赖如 CREA(https://corpus.rae.es/creanet.html)和 CORPES(https://www.rae.es/corpes/)等通用参考语料库,要么依赖为特定体裁或语言变体构建的定制语料库。主要

相似文章

APEX-VW:医疗领域文档级英西译后编辑数据集

arXiv cs.CL

本文介绍了APEX-VW,一个基于NHS虚拟病房文档并在Trados Studio中进行专业译后编辑构建的新型文档级英西译后编辑数据集。该语料库旨在支持术语规范化、纠正传播以及人在回路翻译支持的研究。