从科学论文中提取问题和方法句子:使用公式化表达脱敏的上下文增强Transformer
摘要
本文提出了一种使用公式化表达脱敏的上下文增强Transformer,用于从科学论文中提取问题和方法句子,在两个数据集上分别实现了3.71%和2.67%的宏F1分数提升。
arXiv:2606.26481v1 Announce Type: new
摘要:数十亿的科学论文使得从海量文本中识别关键部分成为必要。科学研究是从提出问题到运用方法的活动。为了学习科学论文的主旨,我们专注于提取问题和方法句子。对科学论文中的句子进行标注耗费人力,导致数据集规模较小,限制了模型可学习的信息量。这种有限的信息导致模型严重依赖特定形式,进而降低了它们的泛化能力。本文从三个角度解决小规模数据集带来的问题:增加数据集规模、减少对特定形式的依赖、以及丰富句子内的信息。为实现前两个想法,我们引入了公式化表达(FE)脱敏的概念,并提出了基于FE脱敏的数据增强器,以生成合成数据并减少模型对FE的依赖。对于第三个想法,我们提出了一种上下文增强Transformer,利用上下文衡量目标句子中词语的重要性,并减少上下文中的噪声。此外,本文还使用基于大型语言模型(LLM)的上下文学习(ICL)方法进行了实验。定量和定性实验表明,在两个科学论文数据集上,我们提出的模型相比基线模型获得了更高的宏F1分数,分别提升了3.71%和2.67%。基于LLM的ICL方法被发现在问题和方法提取任务中不适用。
查看缓存全文
缓存时间: 2026/06/26 05:16
# 从科学论文中提取问题与方法句子:基于公式化表达脱敏的上下文增强Transformer 来源:https://arxiv.org/abs/2606.26481 查看PDF (https://arxiv.org/pdf/2606.26481) > 摘要:数十亿篇科学论文的存在使得从海量文本中识别关键部分成为必要。科学研究是从提出问题到使用方法的活动。为了把握科学论文的主旨,我们聚焦于提取问题句子和方法句子。对科学论文中的句子进行标注需要大量人力,导致数据集规模较小,限制了模型可学习的信息量。这种有限的信息使模型严重依赖特定形式,进而降低了其泛化能力。本文从三个角度解决小规模数据集带来的问题:扩大数据集规模、减少对特定形式的依赖、以及丰富句子内部的信息。为实现前两个目标,我们引入公式化表达(FE)脱敏概念,并提出基于FE脱敏的数据增强器,用于生成合成数据并减少模型对FE的依赖。针对第三个目标,我们提出一种上下文增强Transformer,利用上下文衡量目标句子中词语的重要性,并降低上下文中的噪声。此外,本文还使用基于大语言模型(LLM)的上下文学习(ICL)方法进行了实验。定量和定性实验表明,在两个科学论文数据集上,我们提出的模型相比基线模型的宏F1分数分别提升了3.71%和2.67%。基于LLM的ICL方法被发现不适用于问题和方法的提取任务。 ## 提交历史 来自:张志诚 [查看邮箱](https://arxiv.org/show-email/478a056a/2606.26481) **[v1]** 2026年6月25日 星期四 00:42:16 UTC (1,327 KB)
相似文章
ProtSent:蛋白质句子转换器
本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。
The Context-Ready Transformer
本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。
论Transformer的表达能力
一篇综述论文,考察Transformer作为语言识别器的表达能力,运用电路复杂性的概念和方法将其与经典计算模型进行比较。
SeDT: Sentence-Transformer Decision-Transformer条件化用于多轮对话可靠性
本文介绍了SeDT,一种无需训练、推理时的方法,通过用来自三种信号的累积相关性分数标注对话历史,提高多轮对话中LLM的可靠性,在Lost-in-Conversation基准测试上实现了高达+37.7%的性能提升。
评估经典与Transformer模型在文档敏感性分类中的性能
本文介绍了Strategic 16K,一个用于文档敏感性分类的泄露控制数据集,并对经典与基于Transformer的模型进行了基准测试,其中BERT在解决标签泄露问题的同时取得了最佳性能。