标准词嵌入属性的实证研究

arXiv cs.CL 论文

摘要

本文综述了词嵌入计算的各种机制,研究了流行的工具包和嵌入矩阵,并通过选定的实现进行实验以理解其特性。

arXiv:2607.23675v1 公告类型: 新 摘要:将词序列嵌入到连续向量空间是近年来自然语言处理领域最重要的进展之一。这些嵌入已在自动语音识别、机器翻译、情感分析等多个领域得到应用。本文回顾了为计算词嵌入而提出的各种机制,研究了公共领域中可用的流行工具包和嵌入矩阵,并通过一个或多个选定的实现进行实验,以更好地理解其特征。 La repr\'esentation vectorielle continue de mots a \'et\'e l'un des d\'eveloppements les plus importants dans le domaine du traitement automatique du langage naturel au cours des derni\`eres ann\'ees. Ces repr\'esentations ont trouv\'e application dans des domaines tels que la reconnaissance vocale, la traduction automatique, l'analyse des sentiments, etc. Ce travail passe en revue les diff\'erents m\'ecanismes propos\'es pour le calcul de ces vecteurs de mots, \'etudie les kits d'outils populaires et les matrices disponibles publiquement en ligne, et exp\'erimente avec une ou plusieurs impl\'ementations s\'electionn\'ees pour mieux comprendre leurs caract\'eristiques.
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:30

# 标准词嵌入属性的实证研究 来源: https://arxiv.org/html/2607.23675 Salomon Kabongo Kabenamualu \(salomon@aims\.ac\.za\) 非洲数学科学研究所 \(AIMS\) 导师: Etienne Barnard 教授 西北大学 \(2019年5月23日 提交以部分满足结构化硕士学位要求于AIMS南非 ![[无标题图片]](https://arxiv.org/html/2607.23675v1/x1.png)\) ## 摘要 将词序列嵌入到连续向量空间是近年来自然语言处理领域最重要的进展之一。这种嵌入已应用于自动语音识别、机器翻译、情感分析等多个领域。本文回顾了各种已提出的词嵌入计算机制,调查了公共领域可用的流行工具包和嵌入矩阵,并通过一个或多个选定的实现进行实验,以更好地理解其特性。词序列的连续向量表示是近年来自然语言处理领域最重要的进展之一。这些表示已应用于语音识别、机器翻译、情感分析等领域。本文回顾了各种用于计算这些词向量的机制,研究了在线公共可用的流行工具包和矩阵,并通过一个或多个选定的实现进行实验,以更好地理解其特性。 关键词: NLP, 嵌入, 神经网络, 机器学习。 ### 声明 本人,签署人,特此声明本研究项目中的工作是我的原创工作,他人或本人之前所做的任何工作均已在适当位置注明出处。 ![[无标题图片]](https://arxiv.org/html/2607.23675v1/images/signature.png) Salomon KABONGO KABENAMUALU, 2019年5月23日 ###### 目录 1. 摘要 (https://arxiv.org/html/2607.23675#Chx1) 2. 1 引言 (https://arxiv.org/html/2607.23675#Ch1) 3. 2 NLP及其应用概述 (https://arxiv.org/html/2607.23675#Ch2) 1. 2.1 自然语言处理 (https://arxiv.org/html/2607.23675#Ch2.S1) 1. 2.1.1 监督学习 (https://arxiv.org/html/2607.23675#Ch2.S1.SS1) 2. 2.1.2 无监督学习 (https://arxiv.org/html/2607.23675#Ch2.S1.SS2) 3. 2.1.3 半监督学习 (https://arxiv.org/html/2607.23675#Ch2.S1.SS3) 4. 2.1.4 强化学习 (https://arxiv.org/html/2607.23675#Ch2.S1.SS4) 2. 2.2 人工神经网络 (https://arxiv.org/html/2607.23675#Ch2.S2) 1. 2.2.1 感知器 (https://arxiv.org/html/2607.23675#Ch2.S2.SS1) 2. 2.2.2 前馈神经网络 (https://arxiv.org/html/2607.23675#Ch2.S2.SS2) 3. 2.2.3 Sigmoid (https://arxiv.org/html/2607.23675#Ch2.S2.SS3) 4. 2.2.4 双曲正切 (tanh) (https://arxiv.org/html/2607.23675#Ch2.S2.SS4) 5. 2.2.5 ReLU (https://arxiv.org/html/2607.23675#Ch2.S2.SS5) 6. 2.2.6 Leaky ReLU (https://arxiv.org/html/2607.23675#Ch2.S2.SS6) 3. 2.3 深度神经网络 (https://arxiv.org/html/2607.23675#Ch2.S3) 1. 2.3.1 训练神经网络 (https://arxiv.org/html/2607.23675#Ch2.S3.SS1) 2. 2.3.2 损失函数与评估函数 (https://arxiv.org/html/2607.23675#Ch2.S3.SS2) 3. 2.3.3 梯度下降与反向传播 (https://arxiv.org/html/2607.23675#Ch2.S3.SS3) 4. 2.3.4 正则化 (https://arxiv.org/html/2607.23675#Ch2.S3.SS4) 4. 2.4 NLP应用 (https://arxiv.org/html/2607.23675#Ch2.S4) 1. 2.4.1 词性标注 (POS) (https://arxiv.org/html/2607.23675#Ch2.S4.SS1) 2. 2.4.2 问答 (https://arxiv.org/html/2607.23675#Ch2.S4.SS2) 3. 2.4.3 命名实体识别 (NER) (https://arxiv.org/html/2607.23675#Ch2.S4.SS3) 4. 2.4.4 语音识别 (https://arxiv.org/html/2607.23675#Ch2.S4.SS4) 5. 2.4.5 机器翻译 (https://arxiv.org/html/2607.23675#Ch2.S4.SS5) 6. 2.4.6 语义相关词 (https://arxiv.org/html/2607.23675#Ch2.S4.SS6) 7. 2.4.7 情感分析 (https://arxiv.org/html/2607.23675#Ch2.S4.SS7) 4. 3 神经网络嵌入 (https://arxiv.org/html/2607.23675#Ch3) 1. 3.1 特征表示 (https://arxiv.org/html/2607.23675#Ch3.S1) 1. 3.1.1 稀疏词表示 (One Hot) (https://arxiv.org/html/2607.23675#Ch3.S1.SS1) 2. 3.1.2 密集词表示 (令牌嵌入) (https://arxiv.org/html/2607.23675#Ch3.S1.SS2) 2. 3.2 嵌入 (https://arxiv.org/html/2607.23675#Ch3.S2) 3. 3.3 词袋模型 (https://arxiv.org/html/2607.23675#Ch3.S3) 1. 3.3.1 词频 (tf) (https://arxiv.org/html/2607.23675#Ch3.S3.SS1) 2. 3.3.2 词频-逆文档频率 (tf-idf) (https://arxiv.org/html/2607.23675#Ch3.S3.SS2) 4. 3.4 Word2Vec (https://arxiv.org/html/2607.23675#Ch3.S4) 1. 3.4.1 连续词袋模型 (CBOW) (https://arxiv.org/html/2607.23675#Ch3.S4.SS1) 2. 3.4.2 skip-gram (https://arxiv.org/html/2607.23675#Ch3.S4.SS2) 5. 3.5 GloVe (https://arxiv.org/html/2607.23675#Ch3.S5) 6. 3.6 fastText (https://arxiv.org/html/2607.23675#Ch3.S6) 7. 3.7 我们的模型架构 (https://arxiv.org/html/2607.23675#Ch3.S7) 1. 3.7.1 评估指标 (https://arxiv.org/html/2607.23675#Ch3.S7.SS1) 5. 4 结果与讨论 (https://arxiv.org/html/2607.23675#Ch4) 1. 4.1 数据预处理 (https://arxiv.org/html/2607.23675#Ch4.S1) 1. 4.1.1 收集数据 (https://arxiv.org/html/2607.23675#Ch4.S1.SS1) 2. 4.1.2 探索数据 (https://arxiv.org/html/2607.23675#Ch4.S1.SS2) 2. 4.2 实验与结果 (https://arxiv.org/html/2607.23675#Ch4.S2) 3. 4.3 讨论 (https://arxiv.org/html/2607.23675#Ch4.S3) 6. 5 结论与未来工作 (https://arxiv.org/html/2607.23675#Ch5) 1. 5.1 结论 (https://arxiv.org/html/2607.23675#Ch5.S1) 2. 5.2 未来工作 (https://arxiv.org/html/2607.23675#Ch5.S2) 7. 参考文献 (https://arxiv.org/html/2607.23675#bib) ## 第1章 引言 人类天生具备理解、分析和解释事件的惊人能力——即自然智能或能力。然而,在某些情况下,自然能力可能有限。构建具有巨大处理资源的人工机器是可能的。模仿这些特征的人工智能是人类有史以来所能实现的伟大成就。本文就此回顾了机器学习,这是人工智能的一个子领域。机器学习涵盖不同应用的各种任务。在这里,我们关注的是自然语言处理。人类从很小的时候就开始学习阅读和写作,看似毫不费力。然而,让计算机做同样的事情并不简单。人工智能的真正挑战已被证明是解决那些对人类容易执行但难以正式描述的任务,即我们凭直觉解决、感觉自动完成的问题,例如识别口语单词或图像中的人脸(Goodfellow, 2016 (https://arxiv.org/html/2607.23675#bib.bib14))。在本项目中,我们将解决其中一个直观问题。计算机如何处理文本并有效使用它?自然语言处理的早期方法基于人工制定的规则,但这导致了许多问题,因为有效捕获文本语义和句法含义所需的规则数量迅速膨胀。作为基于规则方法所带来挑战的解决方案,“统计革命”(1990年代初)标志着从基于规则方法向统计NLP方法(机器学习)的转变(Johnson, 2009 (https://arxiv.org/html/2607.23675#bib.bib23))。在过去的20年中,这种方法已被证明非常成功。说到统计,意味着使用数字,这一事实使其变得容易和自然,因为构建神经网络(我们将在本文后面看到)所涉及的数学需要将输入与权重相加(再加偏置),但在NLP中,大多数输入数据是文本。那么问题就出现了:如何以数值方式表示非数值,同时捕获单词之间的洞察?本文将实验几种词表示,并概述各种已提出的计算机制,以及在情感分析任务上的实验。一些工作Goldberg (2016 (https://arxiv.org/html/2607.23675#bib.bib1)), Bengio等人(2003 (https://arxiv.org/html/2607.23675#bib.bib12)) 建议使用更先进的深度学习架构(1D-CNN, RNN)来对序列数据建模,但我们将展示如何使用预训练词嵌入与加权连续词袋相结合可以产生最先进的或接近最先进的结果。在本报告中,术语“特征”用于指代我们神经网络的 linguistic 输入(单词、词性等)。大写粗体字母用于表示矩阵(X,Y...),小写字母用于向量表示(b...),除非另有说明,向量假定为行向量。我们将使用带下标的上标大写粗体字母来表示网络中的不同层矩阵(W^1, W^2...)。本项目组织如下。在第二章 (https://arxiv.org/html/2607.23675#Ch2)中,我们给出自然语言处理的概述并讨论其一些应用。第三章 (https://arxiv.org/html/2607.23675#Ch3)讨论神经网络嵌入,并介绍公共领域可用的词嵌入矩阵及其计算。第四章 (https://arxiv.org/html/2607.23675#Ch4)给出情感分析任务的实验结果,最后第五章 (https://arxiv.org/html/2607.23675#Ch5)总结我们的实证研究并提供一些未来研究的可能方向。 ## 第2章 NLP及其应用概述 本章将介绍自然语言处理(NLP),然后介绍神经网络(NN)作为解决NLP的一种方法,最后讨论其一些应用。 ### 2.1 自然语言处理 自然语言处理(NLP)是一套通过计算机处理和分析自然语言(人类语言)的技术。自然语言处理的当前应用包括情感分析、智能回复、机器翻译、机器人和专家助手。在本节中,我们将概述自然语言处理及其与机器学习的联系。我们不能不谈人工智能就谈NLP,人工智能是NLP可被视为子领域的大领域。人工智能(AI)是计算机科学的一个领域,旨在使计算机能够在需要时做出适当决策,而无需人类显式交互。自然语言处理之于人工智能,正如语言(口语和书面语)之于人类。它是Siri、Google Assistant等技术背后的主要引擎。自然语言处理被认为是计算机科学中的一个难题,这是由于人类语言的模糊性和不精确特性。该领域的早期根源可以追溯到二战后(1940年代-1950年代)众所周知的“智力肥沃时期”,自那时起,大多数NLP系统基于一组复杂的手写规则。然而,在1980年代,NLP因引入机器学习算法而革命化,而直到2010年,深度神经网络才在自然语言处理中变得广泛。IBM研究被许多人认为是该领域早期多项成功的原因。机器学习可以定义为人工智能的一个子领域,旨在让计算机从数据中学习。深度神经网络在NLP中的引入导致了该领域增长的重大转变,并且是当前趋势和惊人应用(如语音识别、自动电子邮件回复、机器人专家代理等)的原因。参见图2.1 (https://arxiv.org/html/2607.23675#Ch2.F1)了解人工智能、机器学习和深度学习之间的关系。 参考题注 图2.1: 人工智能、机器学习和深度学习 下一小节将介绍四种主要的机器学习任务。 #### 2.1.1 监督学习 监督学习是一种机器学习任务,它向模型提供多个示例——特征(输入)和标签(输出)——以便模型能够泛化到未见数据。令 \( \{(x_1, y_1), \ldots, (x_n, y_n)\} \) 为 \( n \) 个示例的集合——训练数据。监督学习包括向模型 \( f \) 喂入数据,粗略地说,给 \( f \) 输入 \( (x_i) \) 和输出 \( (y_i) \) 的示例,使得:
\[
f(x_i) \approxeq y_i \quad \text{for } i \in \{1,2,\cdots,n\}
\]
称 \( f_{fid} \) 为喂入后的函数 \( f \)。目标是使 \( f_{fid} \) 能够根据未见数据——测试数据预测 \( y_j \) 的值,其中 \( j \in \{a,b,\cdots,m\} \)。令 \( \{x_a, x_b, \cdots, x_m\} \) 为未见数据,我们希望知道未知标签 \( \{y_a, y_b, \cdots, y_m\} \)。为了能够衡量模型的性能,作为经验法则,训练数据被分成两部分:
- 训练数据:通常为总训练数据的80%
- 验证数据:剩余百分比,将被视为未见数据。
将总训练数据分成两部分的动机是能够拥有已知的标签(输出),这些标签可以用来评估 \( f_{feed}(x_i) \) 与 \( y_i \) 的差异程度,其中 \( i \in \) 评估数据。有几种可用于监督学习方法的机器学习算法,包括神经网络,选择哪一种通常是一个经验问题,因为这取决于手头的数据。 #### 2.1.2 无监督学习 无监督学习是一种机器学习任务,也称为自组织,包括利用未标记数据。与监督方法相反,这种方法有一组没有输出的输入,我们构建模型来学习这些输入的内部表示以便进行预测。无监督任务被认为比监督任务更难(准确性较低),但其吸引力在于大多数可用数据是未标记的。一些最常用的无监督学习包括聚类、异常检测和神经网络。 #### 2.1.3 半监督学习 半监督学习是一类机器学习任务,它利用未标记数据与小量标记数据一起进行训练。它介于前两种机器学习任务(监督学习和无监督学习)之间。作为经验法则,机器学习研究人员发现,向无监督学习添加少量标记数据可以显著提高其准确性。自然语言研究人员主要对无监督和半监督学习感兴趣,因为大多数可用的文本数据通常是未标记的。 #### 2.1.4 强化学习 强化学习可以视为监督学习的一个特例。该任务旨在训练一个智能体,使其学会在环境中执行动作,以最大化某种累积奖励(相对于惩罚)的概念。 ### 2.2 人工神经网络 人工神经网络(ANN)或简称为神经网络(NN)是

相似文章

文本嵌入中情感线索的跨心理学情绪理论比较研究

arXiv cs.CL

本文评估了十二种最新文本编码器在三种心理学情绪理论中编码情感线索的能力,发现指令感知的开源权重编码器在单词级别上达到或超过专有编码器,而任务微调嵌入在句子级别上更优。

介绍文本和代码嵌入

OpenAI Blog

OpenAI 推出了新的嵌入 API 端点,可以将文本和代码转换为数值向量表示,用于语义搜索、聚类和分类任务。这些模型在标准基准测试上取得了最先进的效果,包括代码搜索性能相比之下提升了 20%。

STEB:风格文本嵌入基准

arXiv cs.CL

介绍风格文本嵌入基准(STEB),这是一个全面的开源基准,用于标准化跨96个数据集和7种语言的风格嵌入评估,研究发现语义嵌入在风格任务中表现不佳。

用Toki Pona检验Word2Vec的极限

arXiv cs.CL

本文研究了Word2Vec能否为仅含约130个词汇的人造语言Toki Pona生成有意义的语义嵌入,使用了一个包含140万句子的语料库,并考察了非Toki Pona标记对嵌入质量的影响。