使用递归神经张量网络检测生物医学文本中的推测性语言
摘要
本文探讨了利用分布式句子表示自动检测生物医学文章中的推测性语言,将递归神经张量网络和段落向量与支持向量机及其他基线方法进行比较,发现RNTN取得了最佳F1分数0.885。
arXiv:2606.10471v1 公告类型:新
摘要:在本研究中,我们利用分布式句子表示和先进的深度学习技术,深入探讨了生物医学文章中推测性语言的自动检测。此类识别的意义涉及信息检索、多文档摘要以及新知识的探索。我们探索了两种获取分布式句子表示的不同方法:段落向量模型和递归神经张量网络。然后,将这些方法与三种基础基线算法进行严格比较:支持向量机、朴素贝叶斯和模式匹配。我们的研究结果显示,递归神经张量网络(RNTN)的性能略优于表现最佳的基线——线性双词支持向量机(F1 = 0.881),其F1分数为0.885。同时,段落向量模型的效果较差(F1 = 0.368),即使使用大规模未标记数据集进行广泛训练也是如此。我们就影响这些性能差异的因素进行了全面讨论,并为未来的研究方向提出了有益的见解。
查看缓存全文
缓存时间: 2026/06/10 06:11
# 检测生物医学文本中的推测性语言:基于递归神经张量网络
来源:https://arxiv.org/html/2606.10471 \[1\]\\fnmDhruv\\surDixit \[1\]\\orgdiv电气与计算机工程系,\\orgname史蒂文斯理工学院,\\orgaddress\\city霍博肯,\\state新泽西州,\\country美国
###### 摘要
在本研究中,我们利用分布式句子表示和先进的深度学习技术,深入探索生物医学文章中推测性语言的自动检测。此类识别的意义在于信息检索、多文档摘要以及新知识的探索中。我们的探索涵盖了两种不同的句子分布式表示获取方法:段落向量模型和递归神经张量网络。随后,将这些方法与三个基础基线算法进行严格比较:支持向量机、朴素贝叶斯和模式匹配。我们的研究结果表明,递归神经张量网络(RNTN)在性能上略优于表现最佳的基线——线性二元词袋SVM(F1=0.881),其F1得分为0.885。而段落向量模型即使在利用大规模未标注数据集进行广泛训练后,效果仍较差(F1=0.368)。我们全面讨论了影响这些性能差异的因素,并为未来的研究方向提供了富有洞见的建议。
###### 关键词:推测性语言检测,生物医学文本挖掘,递归神经张量网络,段落向量,支持向量机
## 1 引言
生物医学领域已发表的论文既包含已确立的坚实事实,也包含代表新思想或新发现的、尚不稳固的新知识\[Medlock2008\]。考虑以下例句:
*该研究证明启动子是有效的。*
*该研究暗示启动子可能是有效的。*
第二句包含诸如“暗示”和“可能”之类的提示词与短语,使得“启动子是有效的”这一内容成为推测性陈述。自动识别这类推测性陈述将确保信息检索系统不会将不稳固的信息误当作事实。此前此类工作采用模式匹配\[Malhotra2013\]、概率弱监督学习模型和支持向量机\[Medlock2007\]等方法。这些方法使用词袋(BoW)方法,即用每个元素表示词频(对于一元词袋)或词对(对于二元词袋)来表示文本。这种方法存在两个缺陷:一是丢失了词序,二是忽略了词义\[Le2014\]。词序和词义对于推测性语言识别任务至关重要,因为一个句子的推测性不仅取决于提示词的存在,还取决于它们出现的上下文。研究表明,词的分布式表示能够捕获语义信息\[mikolov2013efficient\]。这是一种连续特征表示,而非BoW中的布尔或整数特征。机器学习的最新进展使得学习任意长度句子和文本的分布式表示也成为可能。本研究展示了使用两种方法(段落向量\[Le2014\]和递归神经张量网络\[Socher2013\])应用分布式表示的可能性。我们假设,将句子的分布式表示应用于生物医学文章中的推测性语言识别任务,相比基线算法能够提升性能。我们使用F1分数、ROC曲线和精确率-召回率曲线来评估这两种方法以及基线的性能。接下来,第二节展示相关工作。第三节详细描述段落向量表示和递归神经张量网络方法。第四节介绍这些方法与所考虑基线的评估。第五节包含讨论、发现以及所用方法的局限性。我们在第六节进行总结。
## 2 相关工作
推测性语言识别,尤其是在生物医学领域,已经研究多年。最早涉及该任务的论文之一讨论了基于SVM的文本分类方法和子串匹配方法\[Light2004\]。在\[Medlock2007\]中,提出了一种用于训练数据获取和分类的弱监督概率模型。他们的模型使用带平滑的朴素贝叶斯,以避免在有限数据训练时出现不可靠的频率估计。我们探索了类似的方法作为基线之一。在\[vlachos2010detecting\]中,我们引入了一个采用拉普拉斯先验的贝叶斯逻辑回归分类器。他们将推测检测任务转化为标记分类任务,即每个单独的标记被指定为提示词,并进一步确定每个提示词的范围。最近的一项工作\[Malhotra2013\]描述了一个使用模式字典的模式匹配模型。
## 3 方法
### 3.1 数据集
我们的标注数据集来自BioScope语料库\[bioscope\];未标注数据集来自BioMed Central\[biomed\]。BioScope语料库是一个以XML格式描述的生物医学文章数据集。每个句子的解析方式如下:对于每个推测性句子,导致推测的提示词/短语以及推测的范围都被标记。在以下示例中,“本研究鉴定的新型增强子元件可能是正负调控因子的靶点。”整个句子的范围被界定,推测性提示词“可能”已被标记,推测的范围也已被标记。BioMed语料库也包含XML格式的生物医学文章。它与BioScope语料库有两个关键区别:它大得多(超过20万篇文章,而BioScope为1273个段落摘要和九项研究),且句子未标注为推测/非推测。我们使用了BioMed语料库的一个子集来扩大段落向量方法的训练。所有其他方法仅在BioScope语料库上进行训练和测试。数据集中的所有句子均转换为小写。
### 3.2 段落向量表示
段落向量(PV)方法遵循\[Le2014\]中的描述。它包含两个模型。在测试时,段落向量模型输出测试句子的固定长度向量。然后,一个逻辑分类器根据该段落向量输出二元标签。¹¹¹为了与\[Le2014\]中使用的术语保持一致,我们使用“段落向量”来指代句子的固定长度特征向量。在本研究中,测试和训练实例是句子,但段落向量算法能够学习任意长度文本(例如短语、句子和段落)的特征向量。
#### 数据集
数据集划分如下:我们将BioScope语料库中70%的句子分配给训练集,30%分配给测试集。为了利用大规模未标注数据集,如果适用,我们将BioMed语料库子集中的句子附加到训练集中。因此,PV模型是在标注和未标注句子的混合体上进行训练的。
**图1:网络架构,段落向量模型** \[Le2014\]
#### 训练PV模型
这被称为段落向量的分布式记忆方法。该模型维护一个词向量矩阵 \( W \in \mathbb{R}^{N \times p} \) 和一个段落向量矩阵 \( P \in \mathbb{R}^{M \times p} \),其中 \( N \) 指训练句子的数量,\( M \) 是训练集中唯一词的数量,\( p \) 指特征向量的维度。输入层是训练句子的段落向量与滑动窗口内词的词向量的拼接。输出层是softmax。训练目标是预测滑动窗口后的下一个词。该目标函数通过随机梯度下降进行最小化,梯度通过反向传播计算。误差梯度反向传播至输入层。在训练时,我们学习 \( W \)、\( P \) 和 softmax 权重。我们使用逻辑分类器的F1分数来评估PV模型的质量并决定何时停止训练。²²²我们不监测训练误差,而是采用此方法,因为gensim库存在限制:API在每次迭代后不返回训练误差。每个训练周期后,我们使用已学习的、带有标签的段落向量(来自BioScope语料库的句子)训练一个逻辑分类器。当该逻辑分类器的F1分数开始下降时,即F1分数刚达到最大值后,我们停止训练PV模型。有关其他考虑过的评估方法,请参见讨论部分。学习率恒定为0.001,特征长度 \( p \) 为52。未进行交叉验证。
#### 训练逻辑分类器
在PV模型训练完成后,我们训练PV方法的第二个模型,即逻辑分类器。训练示例是来自BioScope语料库的已学习段落向量及其对应标签。实际上,我们直接采用PV模型训练过程中最后训练好的逻辑分类器(见上文)。
#### 测试新句子
在测试时,我们冻结softmax权重和 \( W \),并在测试句子上运行滑动窗口,通过随机梯度下降学习一个段落向量。然后,该段落向量由逻辑分类器标记。测试时的迭代次数固定为50,学习率为0.001。
#### 实现细节
PV模型方法使用Python实现。我们使用gensim库实现PV模型,使用scikit-learn库实现逻辑分类器。为了将BioMed语料库中的文本块分割成句子列表,我们使用NLTK的英语Punkt句子分词器。为了将句子分割成词/标点列表,我们使用NLTK的 `nltk.word_tokenize` 函数。
**图2:示例句子的推测标签解析树:the study indicated that the promoter is probably effective**
### 3.3 递归神经张量网络
当试图充分捕捉较长短语中蕴含的复杂含义时,局限于单个词的语义向量空间的局限性变得明显。为了克服这一缺陷,\[Socher2013\]提出了一种创新策略,即利用完全标注的解析树来剖析语言中蕴含的情感的微妙组成。作为该研究基石的斯坦福情感树库包含了使用斯坦福解析器生成的二元解析树,并由人类评估者精心标注。为了提高组合分析的精度,\[Socher2013\]引入了递归神经张量网络(RNTN)。这种开创性的神经架构能够接受不同长度的短语作为输入数据。它通过词向量和解析树的组合来巧妙地表示短语,随后通过应用一致基于张量的组合函数,为解析树中更高级别的节点推导出向量。我们探索将相同思想应用于推测性语言识别任务的可能性。由于我们的数据集——BioScope语料库\[Vincze2008\]——已经标记了推测性提示词,我们用它来标注解析树,而非人工评判。我们现在描述解析树的生成和标注,以及使用示例句子训练RNTN:“the study indicated that the promoter is probably effective”.
**图3:通过使用标记为g的组合函数,以升序过程生成更高层次的向量,并将节点向量用作相应节点上分类器的不同特征** \[Socher2013\]
**图4:递归神经张量网络的单层结构,每个虚线隔间代表其中一段,能够捕捉子节点对其父节点施加的特定影响形式** \[Socher2013\]
#### 解析树生成与标注
句子首先输入斯坦福解析器,该解析器标记句子的词性(PoS)。然后使用以下启发式方法自动标注该解析树的节点:任何包含整个提示词短语的节点被标记为推测性,所有其他节点被标记为非推测性。示例句子的标注解析树如图2所示(https://arxiv.org/html/2606.10471#S3.F2)。‘+’标签表示推测性节点,‘-’标签表示非推测性节点。从BioScope语料库中获取的14539个句子均获得了这样的标注解析树,然后按60%/10%/30%的比例分别划分为训练/交叉验证/测试集。测试集和训练集的分词均使用斯坦福解析器完成。这是一个智能的词分词器,将括号、逗号和句点视为词。通过观察,其解析方式似乎与PV方法中使用的NTLK `ntlk.word_tokenize` 函数类似。
#### 训练RNTN
然后按照\[Socher2013\]的描述,使用RNTN训练标注的解析树。每个单独的术语由一个维度为 \( d \times d \) 的矩阵表示。该矩阵的元素被调整以减轻每个顶点处的分类差异。对所有节点使用基于张量的组合函数。在图四中,b’和c’表示子节点的词向量(参见图4(https://arxiv.org/html/2606.10471#S3.F4)),而 \( V \in \mathbb{R}^{2d \times 2d \times d} \) 代表定义多个双线性结构的张量。b’和c’的合并向量与 \( V \in \mathbb{R}^{d \times d} \) 的每个部分相乘,而 \( W \in \mathbb{R}^{d \times 2d} \) 表示已学习的权重矩阵。与词矩阵一起,每个节点配备一个softmax分类器,该分类器使用其向量表示进行训练,旨在预测标记为 \( t \) 的目标向量。每个节点的目标分布向量通过0-1编码方法构建。由于我们的任务有两类,即推测性和非推测性,\( t \) 的长度为2,形式分别为 \([1,0]\)(推测性)和 \([0,1]\)(非推测性)。利用预测结果与精确结果之间的KL散度,目标是提高正确预测的可能性。RNTN框架中的误差传播是通过导航其内在配置实现的。为了深入理解这一过程,建议读者参考\[Socher2013\]中的详尽阐述。
#### 测试新句子
对于每个句子,使用斯坦福解析器生成一个二元解析树。然后使用训练好的RNTN模型预测解析树每个节点的推测性。根据根节点的分类结果,将句子分类为推测性或非推测性。
## 4 评估
### 4.1 基线算法
我们将三种基线算法应用于识别句子中推测性语言的任务——线性支持向量机(SVM)、朴素贝叶斯(NB)和模式匹配。
#### 线性SVM、NB
对线性SVM和NB,我们以相同方式预处理句子。每个句子被转换为一个布尔词袋(BoW)表示。BoW中的每个元素相似文章
一种用于生物医学与临床文本抽取式摘要的混合分层1D-CNN-BiLSTM框架
本文介绍了一种混合分层1D-CNN-BiLSTM框架,用于生物医学与临床文本的抽取式摘要,旨在通过直接从源文档中选择句子而不是生成新文本来保持事实性。
针对免疫介导疾病的专科医学语言模型
本文提出了一种针对免疫介导和感染性疾病的专科医学语言模型,用于从临床叙述中提取信息。该模型采用BiLSTM-CNN-Char架构,在371份病例报告的精标语料库上训练,F1得分达到0.89。
@neural_avb:上个月我为 @TDataScience 写了这篇关于递归语言模型的文章……绝对精彩,大家都去读吧!
关于在 Towards Data Science 上发表的一篇递归语言模型文章的推广推文。
临床随访指令的可靠提取:一种混合神经符号流水线
本文提出了一种混合神经符号流水线,用于从临床笔记中提取随访指令,使用BioBERT和确定性日期算术。与生成式基线相比,实现了高性能(Pair F1约0.99)。
图自监督学习对现实世界噪声的鲁棒性:基于文本驱动生物医学图的案例研究
本文介绍了 NATD-GSSL 框架,用于评估图自监督学习在含噪声的文本驱动生物医学图上的鲁棒性。研究表明,尽管存在现实世界的噪声,某些 GNN 架构和 pretext tasks(辅助任务)仍能保持性能,为在不完美数据集上进行无监督学习提供了实用指导。