Wiktionary作为英语方言的众包词典
摘要
本文评估了Wiktionary作为符合伦理的众包英语方言词典,展示了其与传统词典相比的覆盖范围以及在地理标记社交媒体数据上的表现。
arXiv:2608.15641v1 公告类型:新
摘要:本文评估了Wiktionary作为符合伦理的众包英语方言词典。我们采用两阶段方法,首先深入描述性分析了12种英语国家变体的众包词典,然后将该词典应用于地理标记的国家级社交媒体语言数据,以检验这一众包方言词典的实际表现。我们证明,对于地区和外围圈变体,Wiktionary的覆盖范围与或超过传统词典,如《牛津英语词典》(OED)。我们对新西兰英语的特定案例研究发现,基于构词模式,Wiktionary与OED高度一致(R = 0.883)。类似地,我们观察到方言词典与地理标记社交媒体语言之间高度一致。虽然本文发现Wiktionary在词汇属性方面具有广泛覆盖,但也突显了评估方言响应语言资源和工具所涉及的一些宏观挑战,如语言接触在方言中的作用以及网络语料库中的语域效应。
查看缓存全文
缓存时间: 2026/08/18 10:12
# 维基词典作为英语方言众包词典的评估 来源:https://arxiv.org/html/2608.15641 作者:悉尼·黄 所属机构:奥塔哥大学可持续发展研究中心 所属机构:复杂系统卓越研究中心 Te Pūnaha Matatini 电子邮件:[sidney\.wong@otago\.ac\.nz](mailto:) ###### 摘要 本文评估了维基词典作为英语方言伦理众包词典的价值。我们采用两阶段方法:首先对12种国家英语变体的众包词典进行深入描述分析,然后将该词典应用于地理标记的国家级社交媒体语言数据,以检验该众包方言词典的实际表现。研究表明,维基词典在区域及外圈变体的覆盖范围上达到或超越了《牛津英语词典》(OED)等传统词典。我们针对新西兰英语的方言案例研究发现,基于构词模式(R = 0.883),维基词典与OED呈现高度一致性。同样,我们观察到方言词典与地理标记社交媒体语言之间也具有高度一致性。尽管本文证实维基词典具有广泛的词汇属性覆盖,但也揭示了评估方言敏感型语言资源与工具时面临的一些宏观挑战,例如语言接触在方言中的作用以及网络语体在语料库中的影响。 ## 1 背景与动机 尽管基于Transformer的大语言模型近期取得了进展[19](https://arxiv.org/html/2608.15641#bib.bib11),但开发方言敏感型自然语言处理(NLP)工具与资源的需求依然迫切。这在低资源语言环境中尤为挑战,例如紧密相关的变体或方言[54](https://arxiv.org/html/2608.15641#bib.bib8)。该局限性的关键原因在于系统开发过程中过度依赖网络语料库(包括社交媒体)[27](https://arxiv.org/html/2608.15641#bib.bib23)。因此,对于英语、法语、葡萄牙语和西班牙语等多中心语言,当代系统仍易受地理偏见影响[18](https://arxiv.org/html/2608.15641#bib.bib19)。 随着"网络即语料库"方法的普及[33](https://arxiv.org/html/2608.15641#bib.bib48),提高方言敏感性的一个途径是转向更具地理代表性的社交媒体语言数据语料库[16](https://arxiv.org/html/2608.15641#bib.bib20)。这是因为这些来源的元数据可被视为地理方言变异的基准真相[30](https://arxiv.org/html/2608.15641#bib.bib22)。然而,地理信息并不必然与实际语言行为一致[46](https://arxiv.org/html/2608.15641#bib.bib21)。其他形式的地理偏见(如非本地偏见)[17](https://arxiv.org/html/2608.15641#bib.bib24)可能进一步削弱语料库的代表性。 代表性语料库只是提升NLP系统公平性与可及性的途径之一。评估方言敏感性的资源与工具同样不可或缺。方言词典(包括词典与文本语料库)在发展方言敏感型语言技术中起着关键作用[31](https://arxiv.org/html/2608.15641#bib.bib15)。例如,词典可用于解决词汇外(OOV)问题,尤其在低资源变体或方言中[31](https://arxiv.org/html/2608.15641#bib.bib15)。基于此,我们认为通过伦理方式获取的开源语言资源(如维基词典[1](https://www.wiktionary.org/))为多中心语言环境(如英语)的方言提供了必要的基准词汇信息。 ### 1.1 词典与词库 在最基础层面,词库由语言的基本构件组成。词库不仅限于单词,还包括词缀、词干及更复杂的构式,如短语单位或习语[28](https://arxiv.org/html/2608.15641#bib.bib52)。词库的创建与维护一直是方言学[9](https://arxiv.org/html/2608.15641#bib.bib9)及语言记录与保存[25](https://arxiv.org/html/2608.15641#bib.bib16)的核心活动。最知名的词库形式是词典,这类参考工具用于文本接收、生成或翻译,其发展源于书籍及其他书面媒介的大规模生产[4](https://arxiv.org/html/2608.15641#bib.bib26)。《牛津英语词典》(OED)是最突出的词典范例,其在线版本汇集了超过50万英语词汇与短语的含义、历史与用法[2](https://www.oed.com/)。机构词库远非完备,主要挑战在于规模限制与词汇项的欠规范[35](https://arxiv.org/html/2608.15641#bib.bib12)。 与"非标准"方言(或变体)相关的词库可能面临排斥风险,因为它们常被关注"标准"语言用法的词典忽略。数据收集通常依赖问卷与信息提供者的访谈[9](https://arxiv.org/html/2608.15641#bib.bib9)。由此产生的词库在规模与质量上自然存在差异。以新西兰英语(NZE)为例,现已停止运营的新西兰词典中心曾拥有约4.2万条目的数据库[2](https://arxiv.org/html/2608.15641#bib.bib1)。但此数字并未反映实际使用情况。较新的来源如OED在线版,单独标注为NZE的条目达1404条。这与早期来源形成鲜明对比,后者将新西兰与澳大利亚索引条目合并为仅820条的词库[50](https://arxiv.org/html/2608.15641#bib.bib2)。某些词汇属性(如列表性词汇[15](https://arxiv.org/html/2608.15641#bib.bib4))的排除也对词典编纂构成挑战,因其聚焦于单一词汇单元[35](https://arxiv.org/html/2608.15641#bib.bib12)。 ### 1.2 网络即语料库与在线词典 正如印刷术在词库传播中发挥变革性作用[49](https://arxiv.org/html/2608.15641#bib.bib25),互联网为词库发展提供了新媒介[8](https://arxiv.org/html/2608.15641#bib.bib18)。随着社交媒体成为地理标记语言数据的主要来源,计算方法日益被用于提取词汇方言特征[44](https://arxiv.org/html/2608.15641#bib.bib13)。[22](https://arxiv.org/html/2608.15641#bib.bib10)通过测量随时间变化的相对频率,记录了Twitter(现为X)上创新词汇特征的出现。类似方法被[39](https://arxiv.org/html/2608.15641#bib.bib17)应用于Reddit数据。近期,统计语言模型也被用于提取词汇方言特征[52](https://arxiv.org/html/2608.15641#bib.bib14)。 在线词典(如Urban Dictionary和维基词典)为考察词汇信息提供了另一途径[29](https://arxiv.org/html/2608.15641#bib.bib32)。维基词典是由用户协作编辑的多语言网络词典[41](https://arxiv.org/html/2608.15641#bib.bib3)。与维基百科类似,维基词典是数字公地的一种形式。不同于词典学家策划的已出版词典,维基词典依赖注册志愿者创建单独条目。用户为每个条目贡献词源、发音、定义、用法说明、衍生形式、相关术语、替代表单及翻译。维基词典的众包特性也带来局限性:因志愿者可编辑条目,质量可能参差不齐,且易受错误与虚假信息影响。一个著名案例是,苏格兰语维基百科近半文章由非苏格兰语者撰写,引发对众包质量的严重担忧[7](https://arxiv.org/html/2608.15641#bib.bib34)。 ### 1.3 面向NLP的词库 标注语料库、词库与语法在NLP系统早期发展中至关重要[36](https://arxiv.org/html/2608.15641#bib.bib27)。词库不仅提供形态句法信息,还包含句法语义信息。最早的英语词库之一WordNet[43](https://arxiv.org/html/2608.15641#bib.bib28)提供了词语间的语义关系。其他提供动词句法语义属性的词库包括FrameNet[20](https://arxiv.org/html/2608.15641#bib.bib29)、VerbNet[34](https://arxiv.org/html/2608.15641#bib.bib30)和COMLEX[23](https://arxiv.org/html/2608.15641#bib.bib31)。作为机器可读结构化数据[53](https://arxiv.org/html/2608.15641#bib.bib42)的一种形式,维基词典是词汇语义信息的重要来源[55](https://arxiv.org/html/2608.15641#bib.bib54)。随着基于向量的词嵌入模型[42](https://arxiv.org/html/2608.15641#bib.bib49)的出现,基于维基词典的嵌入被用于适应多语言环境[11](https://arxiv.org/html/2608.15641#bib.bib50)。 随着向基于Transformer的大语言模型(LLM)的转变[40](https://arxiv.org/html/2608.15641#bib.bib36),对WordNet等词库的需求有所减少。同样,LLM现在能够为文本接收、机器翻译及文本生成生成适用的词典与词库[12](https://arxiv.org/html/2608.15641#bib.bib37)。但这并不意味着NLP系统开发对词库的需求已消失[37](https://arxiv.org/html/2608.15641#bib.bib38)。如前所述,词汇外问题在低资源语言环境中仍是重大挑战[31](https://arxiv.org/html/2608.15641#bib.bib15)。即使在最先进的LLM中,高浓度的词汇外项也会导致性能显著下降[1](https://arxiv.org/html/2608.15641#bib.bib35)。同样,标准分词与指令微调并未改善LLM在"非标准"英语变体上的推理任务表现[38](https://arxiv.org/html/2608.15641#bib.bib39)。 ### 1.4 小结 维护劳动密集型方言词典与参考语料库对于低资源或资源匮乏的语言变体往往难以持续。以新西兰词典中心为例,其于2012年停止运营[2](https://arxiv.org/html/2608.15641#bib.bib1)。这是重大挑战,因为词汇是NZE最显著的区别特征[14](https://arxiv.org/html/2608.15641#bib.bib33)。尽管方言词库可能需要数年编纂[35](https://arxiv.org/html/2608.15641#bib.bib12),但维基词典作为词汇方言信息来源的优势在于其近乎实时性[41](https://arxiv.org/html/2608.15641#bib.bib3)。这在源自互联网的新兴词汇方言特征语境中尤为重要[39](https://arxiv.org/html/2608.15641#bib.bib17)。尽管针对英语方言的研究有限,但维基词典已被应用于其他语言语境的方言研究,包括日耳曼语族[5](https://arxiv.org/html/2608.15641#bib.bib45)、汉语族[10](https://arxiv.org/html/2608.15641#bib.bib43)及罗曼语族[47](https://arxiv.org/html/2608.15641#bib.bib44)。 应用程序接口(API)的可用性支持了维基词典条目的伦理获取。这对于数字语料库等语言工具与资源尤为重要,以确保其符合FAIR(可发现、可访问、可互操作、可重用)原则[21](https://arxiv.org/html/2608.15641#bib.bib47)。鉴于地理方言偏见在语言模型开发中仍是重要问题[19](https://arxiv.org/html/2608.15641#bib.bib11),迫切需要为服务不足的方言开发结构化词库与基于词典的特征,以构建公平且可及的NLP应用[31](https://arxiv.org/html/2608.15641#bib.bib15)。为评估维基词典作为众包方言词库的可行性,本研究聚焦两个核心研究问题: - **RQ1** 维基词典的区域英语覆盖范围与OED等传统词库相比如何? - **RQ2** 基于维基词典的特征能否识别跨社交媒体文本语体的区域方言用法? ## 2 方法论 为解答研究问题,我们首先比较维基词典的众包方言词库与已出版词库(即OED)。随后评估这些众包方言词库与地理标记语言数据的一致性。在整个分析过程中,我们结合NZE语境解读结果与发现。作为英语内圈变体中最年轻、地理最孤立且研究最充分的变体之一[26](https://arxiv.org/html/2608.15641#bib.bib46),NZE特别适合探索NLP工具与资源在低资源环境中的有效性。尽管NZE词库的96%与其他内圈变体共享[14](https://arxiv.org/html/2608.15641#bib.bib33),但其词汇仍是最显著的特征,表现为通过定居者殖民主义语言接触产生的大量毛利语借词。 ### 2.1 数据来源 本文的主要目标之一是将维基词典作为开源方言词库,并作为《牛津英语词典》(OED)等机构词典的替代方案进行考察。本节概述维基词典及作为地理标记社交媒体语言数据来源的Reddit。 #### 2.1.1 维基词典:自由的词典 **表1:** 维基词典区域变体类别汇总表,包含子类别数量(n)及示例。 **表2:** Reddit社区汇总表,包含关联的英语国家变体(Country)、社区名称(Community)、截至2025年6月的订阅者数量(Members)及提交帖与评论的总词数(n)和平均词长(x̄)。 截至2024年12月,维基词典英文版包含超过824.5万条目。本研究关注由不同语言变体相关条目组成的定制类别。条目标注有元数据,随后用于生成不同类别。对于英语,条目标注为区域变体,并归入更广的地理类别(大洋洲英语)与子类别(新西兰英语)。表1[1](https://arxiv.org/html/2608.15641#S2.T1)提供了这些类别的摘要。部分类别(如美式英语)进一步细分为次国家级(中西部英语、阿巴拉契亚英语)或社会变体(非裔美国人英语、美式俚语)。我们分析重点关注与英语国家变体对应的子类别。国家变体可分为内圈或外圈变体[32](https://arxiv.org/html/2608.15641#bib.bib5)。内圈指英语为多数语言的国家相关变体;外圈则指前英国殖民地相关变体。我们选取了地理上多样化的六个内圈与六个外圈国家变体或方言样本。 #### 2.1.2 其他数据来源 除了W...
相似文章
让数据说话:利用AI从众包集合中提取关键词
本文评估了三种NLP方法(命名实体识别、关键词提取、主题建模)在自动化提取众包集合关键词中的应用,以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。研究发现,像开放权重模型这样的提取式模型更适合负责任地部署,而生成式AI则带来问责风险。
SWORD:基于Wikidata的扭曲揭示了LLM事实错误拒绝中的隐藏跨语言不一致性
SWORD引入了一个基于Wikidata的基准,用于评估LLM在拒绝事实错误时的跨语言不一致性,揭示模型依赖于分布熟悉度,并在亚洲语言中表现出性能下降。
小编辑,大模型:维基百科倡导如何影响大语言模型价值观
本文证明,一个协调的小规模维基百科编辑活动能够显著影响语言模型处理特定话题的方式,以动物福利为案例研究。
跨语言共识:通过多语言自一致性对齐多语言文化知识
本文提出一个自监督框架,利用多语言自一致性和自我批评机制在不同语言间迁移文化知识,通过从本地语言表征中揭示潜在文化知识,在BLEnD基准测试的英语查询中平均提升5.03%。
词汇共识:人工智能体中的具象词汇学习与共享意义
本文介绍了词汇共识,一个研究人工智能体如何利用视觉嵌入和词汇学习者获得并稳定具象词汇意义的框架,发现感知距离而非语义相关性驱动习得成功。