研究论文的哪些部分最能揭示其研究方法?来自图书馆与信息科学的证据
摘要
本文提出了一种基于全文内容分段的组合策略,用于自动分类学术论文中的研究方法。在来自图书馆与信息科学期刊的标注语料库上的实验表明,方法信息分布不均匀,中后段具有更高的区分能力。
arXiv:2606.19051v1 公告类型:新
摘要:研究方法是学术论文中知识贡献的重要载体。研究方法的自动多标签分类可以支持方法检索、综述生成和研究情报分析等知识服务。现有研究主要依赖标题和摘要,但摘要往往只提供有限的方法信息,而利用全文内容则面临篇幅过长和信息冗余的挑战。因此,本文提出了一种根据物理位置划分全文内容的段落组合策略。使用来自图书馆与信息科学领域三个代表性期刊(JASIST、LISR 和 JDoc)的 1,954 篇全文文章的标注语料库,我们评估了不同段落及其组合在多个模型上的分类性能。实验结果表明,方法信息在全文内容中分布不均匀,中后段和末段具有更强的区分能力。此外,将书目元数据与跨段组合策略相结合,可有效提升分类性能。
查看缓存全文
缓存时间: 2026/06/18 05:47
# 研究论文的哪些部分最能揭示其研究方法?——来自图书馆与信息科学的证据 来源:https://arxiv.org/abs/2606.19051 查看PDF (https://arxiv.org/pdf/2606.19051) > 摘要:研究方法是学术论文中知识贡献的重要载体。研究方法的自动多标签分类可支持方法检索、综述生成和研究情报分析等知识服务。现有研究主要依赖标题和摘要,但摘要通常仅提供有限的方法信息,而利用全文内容则面临篇幅过长和信息冗余的挑战。为此,本文提出一种按物理位置划分全文内容的段落组合策略。利用标注语料(包含来自图书馆与信息科学领域三本代表性期刊JASIST、LISR和JDoc的1954篇全文文章),我们评估了多种模型在不同段落及其组合下的分类性能。实验结果表明,方法信息在全文内容中分布不均,中后部和末尾段落具有更强的区分能力。此外,将书目元数据与跨段落组合策略相结合可有效提升分类性能。 ## 提交历史 来自:张志程 [查看邮箱](https://arxiv.org/show-email/8619b055/2606.19051) **[v1]** 2026年6月17日星期三 13:17:41 UTC(1,620 KB)
相似文章
像科学家一样思考?LLM生成研究方法的结构化研究
本研究探讨了当仅提供研究问题时,LLM如何推荐研究方法(数据集、模型、指标),发现LLM表现出强烈的提供者偏差,且相比实际论文所提出的方法范围要窄得多,这可能会缩小研究者的方法论搜索空间。
基于文本特征分析的研究论文质量识别
本文提出了一个基准,用于将研究论文分类为良好(高被引)和不良(撤回)两类,仅使用标题和摘要的文本特征。通过SVM和神经网络等模型,准确率高达91.12%。
方法是否支持声明?同行评审中的论文内验证
本文介绍了论文内声明验证框架,该框架利用大型语言模型评估论文中的创新声明是否得到方法学证据的支持,填补了现有自动化同行评审系统的空白。人工评估表明,该框架与人类评审员的关注点显著一致,特别是在创新相关问题上。
证据太多,时间太少:通过多目标证据推理从文本到可操作的建议
SCEPTER是一个框架,通过结合PubMed检索、PubMedBERT排序、大语言模型声明提取、矛盾检测和帕累托最优声明选择,将临床病例描述转化为基于证据的建议,实现了192:1的压缩比,同时保持了较高的证据多样性。
基于信息融合的文档分类模式识别:多模态与多视图表示方法的系统综述
本系统综述对139项研究进行了分析,提出了一个统一的框架和元分析,用于通过多模态和多视图信息融合进行文档分类,发现融合提高了准确性(平均提升+5.28个百分点),但也揭示了可重复性挑战。