使用SciBERT在WASP-2025共享任务中实现高效的上下文限制望远镜书目分类

arXiv cs.LG 论文

摘要

本文提出了一种基于SciBERT的望远镜书目自动分类方法,在WASP-2025共享任务中取得了顶尖性能,同时高效处理了上下文长度限制。

arXiv:2609.01647v1 Announce Type: new 摘要:望远镜书目的创建是评估天文台科学影响和确保天文学可重复性的关键部分。此任务涉及识别、分类和链接引用或使用特定望远镜的科学出版物。然而,这一过程在很大程度上仍依赖人工且资源密集。在这项工作中,我们提出了一种高效的基于SciBERT的方法,用于将科学论文自动分类为四类:科学、仪器、提及和非望远镜。尽管有严格的上下文长度限制(最多512个令牌)和有限的计算资源,我们的方法取得了0.89的宏观F1分数,在WASP-2025排行榜上名列前茅。我们分析了截断的影响,并表明即使有一半的样本超过了令牌限制,SciBERT的领域对齐也能实现稳健的分类。我们讨论了截断、分块和长上下文模型之间的权衡,为科学文本管理的效率前沿提供了见解。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:08

# 使用 SciBERT 实现 WASP-2025 共享任务中高效上下文受限望远镜文献分类
来源:https://arxiv.org/html/2609.01647
## 使用 SciBERT 实现 WASP-2025 共享任务中高效上下文受限望远镜文献分类
致谢:我们的代码可在以下网址获取 https://github.com/E0NIA/TRACS-WASP-2025-1st-Place\.

###### 摘要

创建望远镜文献目录是评估天文台科学影响力以及确保天文学研究可重复性的关键环节。这项任务涉及识别、分类和关联引用或使用特定望远镜的科学出版物。然而,这一过程在很大程度上仍然是手动且资源密集型的。在本文中,我们提出了一种基于 SciBERT 的高效方法,用于将科学论文自动分类为四个类别——科学、仪器设备、提及和非望远镜。尽管存在严格的上下文长度限制(最多 512 个词元)和有限的计算资源,我们的方法仍获得了 0.89 的宏 F1 分数,在 WASP-2025 排行榜上名列前茅。我们分析了截断的影响,并表明即使有一半的样本超过了词元限制,SciBERT 的领域对齐特性仍能实现稳健的分类。我们讨论了截断、分块和长上下文模型之间的权衡,为科学文本管理的效率边界提供了见解。

关键词:科学文档处理,多标签分类,SciBERT,文献目录管理,天文学,上下文限制。

## 1 引言

评估观测设施的科学影响力通常依赖于对使用这些望远镜数据的研究出版物进行文献计量分析。创建和维护这些文献目录需要识别相关论文、消除望远镜提及的歧义并分类数据使用性质——这一过程目前仍主要由人工完成。自动化这一过程将极大地惠及图书馆员、档案管理员和研究科学家,通过提高天文学数据的可重复性和可发现性。

WASP-2025 共享任务(Grezes, 2025 (https://arxiv.org/html/2609.01647#bib.bib2); Grezes et al., 2025 (https://arxiv.org/html/2609.01647#bib.bib3))旨在开发能够实现这种文献目录管理自动化的 AI 助手。参与者被要求根据科学论文的文本数据——包括标题、摘要、正文、致谢和资助信息——识别所引用的望远镜,并将每篇论文分类为科学、仪器设备、提及或非望远镜。

大型语言模型(LLMs)能够理解复杂的科学语义,但在严格的计算和输入长度限制下高效地应用它们仍然具有挑战性。在本文中,我们专注于设计一个轻量级但有效的基于 SciBERT 的模型(Beltagy et al., 2019 (https://arxiv.org/html/2609.01647#bib.bib1)),使其能在 512 词元的窗口内运行,这远低于合并样本行的总计 10 万词元上下文。

我们的贡献如下:

- • 我们证明,在受限环境下,领域特定预训练(SciBERT)可以超越大规模通用模型。
- • 我们通过实证分析了词元截断与分类性能之间的权衡。
- • 我们仅使用 Kaggle GPU 资源就达到了排行榜顶尖性能(F1 = 0.89)。

## 2 任务和数据集

该任务包括识别一篇论文是否提及望远镜,并将其与望远镜的关系分类为以下四个标签中的一个或多个:科学、仪器设备、提及和非望远镜。数据集中的每条记录包含:

- • 文本字段:标题、摘要、正文、致谢和资助信息。
- • 元数据:作者、年份和一个唯一的 bibcode。
- • 目标标签:科学、仪器设备、提及和非望远镜,需要进行多标签分类。

表 1:使用 SciBERT 分词器统计的关键文本字段(不含正文)的词元长度。显示了中位数(50%)、第 75 和第 95 百分位数,突显了摘要和致谢部分常常超出典型模型输入限制。训练数据表现出显著的类别不平衡。每个正类标签的频次如下:

- • 科学:37,881
- • 提及:34,813
- • 非望远镜:7,772
- • 仪器设备:875

这项任务的一个主要挑战是输入文本的长度过长。如表 1 (https://arxiv.org/html/2609.01647#S2.T1) 所量化,大量样本包含的文本段本身就超过了标准 Transformer 模型 512 词元的上下文窗口。当包含正文时,所有字段的合并文本可以超过 50,000 词元,造成了严重的上下文限制,这促使我们采用高效、截断上下文模型的方法。

## 3 方法论

### 3.1 基线方法:TF-IDF + 逻辑回归

作为基线,我们实现了一个传统的机器学习流程,结合 TF-IDF 向量化和一对多(One-vs-Rest)逻辑回归分类器。每个样本通过拼接其标题、摘要、致谢和资助部分来表示,各部分之间以 [SEP] 词元分隔。TF-IDF 向量化器配置为双词(1-2 词),词表大小为 20,000,并移除英文停用词。此外,对望远镜类别特征应用了独热编码(one-hot encoding),年份作为数值特征直接输入。

分类器使用 liblinear 求解器,并采用类别平衡权重来处理标签不平衡问题,且包装在一对多策略中以支持四个类别(科学、仪器设备、提及、非望远镜)的多标签分类。模型在 80/20 的训练-验证集划分上进行训练。该基线在训练集上的宏 F1 分数为 0.66,在测试排行榜上达到 0.82,为后续基于 Transformer 的实验提供了有力的基准。

### 3.2 带截断上下文的 SciBERT

我们性能最佳的系统基于 SciBERT (allenai/scibert scivocab uncased),针对四个任务类别(科学、仪器设备、提及、非望远镜)的多标签分类进行了微调。输入文本通过使用特殊的 [SEP] 分隔符连接望远镜名称、年份、标题、摘要、致谢和资助字段构建。所有缺失的文本字段均用空字符串替换以确保一致性。数据被划分为训练集和验证集(80/20),并使用 SciBERT 分词器进行分词,最大序列长度设为 512 词元,截断任何更长的样本。

模型使用 AdamW 优化器训练,学习率为 2e-5,批大小为 48,在 Kaggle 2 * T4 GPU(15 GB 显存)上训练 3 个周期。采用 BCEWithLogitsLoss 损失函数以适应任务的多标签特性,学习率调度通过无预热的线性调度器处理。训练使用 DataParallel 进行分布式处理以利用多 GPU。基于验证集上的宏 F1 分数选择最佳模型,并在出现改进时保存检查点。尽管大约 50% 的样本因超过 512 词元而被截断,该配置仍实现了稳健的泛化,在排行榜上达到了 0.89 的 F1 分数,表明领域特定表征对望远镜文献目录分类具有强大的适应性。

### 3.3 潜在的扩展

如果有更多时间和计算资源,可以进行两项扩展:

分块输入窗口:将长文档分割成重叠的窗口(步幅 = 128),进行多数投票或对预测结果进行平均池化。

Longformer 主干:利用 4096 词元的上下文来捕获来自摘要和致谢部分的扩展信息。

## 4 结果

我们的模型及基线方法的结果见表 2 (https://arxiv.org/html/2609.01647#S4.T2)。尽管 SciBERT 处理的完整上下文不到一半,但它仍然超越了能够处理更长输入的模型。这表明,关键的判别信号集中在标题、摘要和致谢部分。

SciBERT 的截断鲁棒性凸显了领域特定预训练的强大,尤其是在资源有限的情况下。

表 2:我们的模型和基线方法在验证集(CV)和最终排行榜(LB)上的宏 F1 分数。

## 5 讨论

结果表明,像 SciBERT 这样的领域特定语言模型即使在显著的计算约束下,也能高效地自动化望远镜文献目录管理。一个关键观察是,致谢部分与望远镜相关数据的存在强相关,特别是对于像钱德拉(Chandra)或哈勃(Hubble)这样广泛使用的天文台。这表明致谢文本常常编码了数据使用的隐性证据,使其成为分类的信息性输入。然而,由于 Kaggle 平台可用的 GPU 资源有限(P100 GPU,15 GB 显存和 30 GB CPU 内存),实验被限制在最多 512 词元的上下文长度内,较长的输入被截断。尽管有此限制,模型在排行榜上获得了 0.89 的宏 F1 分数,显著优于 GPT-OSS20B(OpenAI, 2025 (https://arxiv.org/html/2609.01647#bib.bib4))基线(0.31)和随机提交(0.24)。像 Longformer 这样的长上下文架构或分块 SciBERT 方法,有可能捕获更广泛的上下文信号,特别是来自完整正文的部分,从而进一步提高分类准确性。

## 6 结论

本文提出了一种轻量级但高性能的方法,用于在 WASP-2025 共享任务中对望远镜相关文献进行分类。从 TF-IDF 基线方法开始,进阶到微调的 SciBERT 模型,该系统在严格的计算限制下取得了最先进的结果。研究结果强调,简洁的上下文——当与领域训练的编码器结合时——能够有效地捕获天文学论文中的科学意图和数据引用。未来的扩展可能包括分段建模、层次化编码或集成长上下文 Transformer 变体,以增强可解释性和召回率。更广泛地说,这项研究突显了 AI 辅助系统在支持科学天文台的文献目录管理和可重复性工作方面的潜力。

## 参考文献

- Beltagy et al. (2019) Iz Beltagy, Kyle Lo, and Arman Cohan. 2019. SciBERT: A pretrained language model for scientific text. In*Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP)*, pages 3615–3620, Hong Kong, China. Association for Computational Linguistics\.
- Grezes (2025) Felix Grezes. 2025. TRACS @ WASP 2025. Kaggle\. https://kaggle.com/competitions/tracs-wasp-2025\.
- Grezes et al. (2025) Felix Grezes, Jennifer Lynn Bartlett, Kelly Lockhart, Alberto Accomazzi, Ethan Seefried, and Tirthankar Ghosal. 2025. Overview of TRACS: The Telescope Reference and Astronomy Categorization Dataset & Shared Task. In*Proceedings of the Third Workshop for Artificial Intelligence for Scientific Publications*\. Association for Computational Linguistics\.
- OpenAI (2025) OpenAI. 2025. gpt-oss-120b & gpt-oss-20b Model Card. *arXiv preprint arXiv:2508.10925*\. https://doi.org/10.48550/arXiv.2508.10925\.

相似文章

CalBrief:大型语言模型证据校准式科学简报的试点诊断基准

arXiv cs.CL

本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。