从科学论文中提取问题和方法句子:使用公式化表达脱敏的上下文增强Transformer

arXiv cs.CL 论文

摘要

本文提出了一种使用公式化表达脱敏的上下文增强Transformer,用于从科学论文中提取问题和方法句子,在两个数据集上分别实现了3.71%和2.67%的宏F1分数提升。

arXiv:2606.26481v1 Announce Type: new 摘要:数十亿的科学论文使得从海量文本中识别关键部分成为必要。科学研究是从提出问题到运用方法的活动。为了学习科学论文的主旨,我们专注于提取问题和方法句子。对科学论文中的句子进行标注耗费人力,导致数据集规模较小,限制了模型可学习的信息量。这种有限的信息导致模型严重依赖特定形式,进而降低了它们的泛化能力。本文从三个角度解决小规模数据集带来的问题:增加数据集规模、减少对特定形式的依赖、以及丰富句子内的信息。为实现前两个想法,我们引入了公式化表达(FE)脱敏的概念,并提出了基于FE脱敏的数据增强器,以生成合成数据并减少模型对FE的依赖。对于第三个想法,我们提出了一种上下文增强Transformer,利用上下文衡量目标句子中词语的重要性,并减少上下文中的噪声。此外,本文还使用基于大型语言模型(LLM)的上下文学习(ICL)方法进行了实验。定量和定性实验表明,在两个科学论文数据集上,我们提出的模型相比基线模型获得了更高的宏F1分数,分别提升了3.71%和2.67%。基于LLM的ICL方法被发现在问题和方法提取任务中不适用。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:16

# 从科学论文中提取问题与方法句子:基于公式化表达脱敏的上下文增强Transformer
来源:https://arxiv.org/abs/2606.26481
查看PDF (https://arxiv.org/pdf/2606.26481)

> 摘要:数十亿篇科学论文的存在使得从海量文本中识别关键部分成为必要。科学研究是从提出问题到使用方法的活动。为了把握科学论文的主旨,我们聚焦于提取问题句子和方法句子。对科学论文中的句子进行标注需要大量人力,导致数据集规模较小,限制了模型可学习的信息量。这种有限的信息使模型严重依赖特定形式,进而降低了其泛化能力。本文从三个角度解决小规模数据集带来的问题:扩大数据集规模、减少对特定形式的依赖、以及丰富句子内部的信息。为实现前两个目标,我们引入公式化表达(FE)脱敏概念,并提出基于FE脱敏的数据增强器,用于生成合成数据并减少模型对FE的依赖。针对第三个目标,我们提出一种上下文增强Transformer,利用上下文衡量目标句子中词语的重要性,并降低上下文中的噪声。此外,本文还使用基于大语言模型(LLM)的上下文学习(ICL)方法进行了实验。定量和定性实验表明,在两个科学论文数据集上,我们提出的模型相比基线模型的宏F1分数分别提升了3.71%和2.67%。基于LLM的ICL方法被发现不适用于问题和方法的提取任务。

## 提交历史

来自:张志诚 [查看邮箱](https://arxiv.org/show-email/478a056a/2606.26481) **[v1]** 2026年6月25日 星期四 00:42:16 UTC (1,327 KB)

相似文章

ProtSent:蛋白质句子转换器

arXiv cs.LG

本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。

The Context-Ready Transformer

arXiv cs.CL

本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。

论Transformer的表达能力

arXiv cs.AI

一篇综述论文,考察Transformer作为语言识别器的表达能力,运用电路复杂性的概念和方法将其与经典计算模型进行比较。