基于文本特征分析的研究论文质量识别
摘要
本文提出了一个基准,用于将研究论文分类为良好(高被引)和不良(撤回)两类,仅使用标题和摘要的文本特征。通过SVM和神经网络等模型,准确率高达91.12%。
arXiv:2608.20368v1 公告类型:新
摘要:知识和创新是由科学研究的质量和可信度所塑造的。然而,区分有影响力、高质量的工作与有缺陷的研究仍然是一项挑战。本文介绍了一个基准,用于将研究论文分类为两类:良好(高被引)和不良(撤回),仅使用标题和摘要的文本特征。我们评估了多种嵌入技术,包括SBERT、Word2Vec、FastText、USE和TF-IDF,结合分类器如支持向量机(SVM)、随机森林和神经网络。我们的贡献包括:(1)超参数透明度,(2)使用t-SNE的特征空间可视化,(3)使用SHAP的模型可解释性分析,以及(4)对错误案例的详细检查。实验结果显示,使用SBERT嵌入的神经网络达到87.22%的准确率,而FastText结合SVM达到91.12%。这些发现强调了文本信息在评估研究质量方面的价值,并提出了部署时的伦理考量。这项工作有助于开发促进可信学术的学术诚信工具。
查看缓存全文
缓存时间: 2026/08/24 04:13
# 1 引言 来源: https://arxiv.org/html/2608.20368 \\patchcmd ###### 摘要 知识与创新的塑造取决于科学研究的质量和可信度。然而,区分具有影响力的高质量工作与有缺陷的研究仍然是一项挑战。本文引入一个基准,用于仅使用标题和摘要的文本特征,将研究论文分类为两类:好的(高引用量)和不好的(已撤回)。我们评估了多种嵌入技术,包括 SBERT、Word2Vec、FastText、USE 和 TF‑IDF,并结合了支持向量机(SVM)、随机森林和神经网络等分类器。我们的贡献包括:(1)超参数透明度,(2)使用 t‑SNE 的特征空间可视化,(3)使用 SHAP 的模型可解释性分析,以及(4)对错误案例的详细检查。实验结果表明,采用 SBERT 嵌入的神经网络达到 87.22% 的准确率,而 FastText 结合 SVM 则达到 91.12%。这些发现突显了文本信息在评估研究质量方面的价值,并讨论了部署时的伦理考量。这项工作有助于开发促进可信赖学术成果的学术诚信工具。 ###### 关键词: 文档识别,论文质量,撤回,引用,分类,学术诚信 \\patchcmd 基于文本特征分析的学术论文质量识别 Saikiran Korlahttps://orcid.org/0009-0002-8129-5383Sadwik Gummadavelli⋆https://orcid.org/0009-0001-8509-344XTrung‑Nghia Lehttps://orcid.org/0000-0002-7363-2610Minh‑Triet Tranhttps://orcid.org/0000-0003-3046-3041Tam V\. Nguyen,✉https://orcid.org/0000-0003-0236-7992 可信研究的根本进步在于学术诚信,但撤回出版物的增加威胁着科学文献的可靠性。Silva 和 Dobranszki\[13 (https://arxiv.org/html/2608.20368#bib.bib1)\]使用论文的引用次数来评估论文作者未来的影响力,在招聘研究人员和教职员工、授予奖项和资金等方面具有潜在应用。未来引用次数是通过使用多个线性回归模型来预测的。Silva 和 Bornemann\[12 (https://arxiv.org/html/2608.20368#bib.bib2)\]研究了 1928 年至 2011 年间被撤回的 4449 篇论文,发现 20% 的撤回是因为研究不端行为,42% 是因为可疑的数据或解释,47% 是因为出版不端行为。高引用的影响力通过引用次数来衡量,它作为质量和创新的基准,而撤回论文则由于不端行为、错误或违反伦理而发生,这些破坏了学术交流的信任。区分论文类别对于研究人员、出版商和同行评审系统至关重要,以维持标准并防止有缺陷工作的传播。 撤回后的研究、引用分析和抄袭检测都已被用于先前的研究以解决学术诚信问题。虽然文本分析为早期检测有问题的论文提供了潜力,但现有方法往往严重依赖元数据或追溯性分类。例如,撤回的研究可能与高影响力的文章具有不同的语言模式,后者通常强调方法论的清晰性和新颖性,而前者可能存在模糊语言、错误或矛盾。通过文本分析捕获这些差异,并借助可解释的可视化(如词云),为自动化研究质量评估提供了一个有前景的方向。 在本文中,我们对流行的机器学习模型进行了基准测试,其中我们将标题、摘要的元数据作为单个文本字符串作为输入。大多数论文是通过阅读标题和摘要被引用的,因此论文的好坏或是否被撤回可以通过引用次数来区分。所以,我们基于标题和摘要关键词训练我们的模型,以确保论文是否应被撤回。我们提供了一种数据驱动的方法,利用摘要和标题来区分已撤回(“不好”)和高引用(“好”)类别。然后,我们提取最先进的文本特征,如 SBERT\[11 (https://arxiv.org/html/2608.20368#bib.bib3)\]、Word2Vec\[9 (https://arxiv.org/html/2608.20368#bib.bib4)\]、FastText\[2 (https://arxiv.org/html/2608.20368#bib.bib5)\]、通用句子编码器(USE)\[3 (https://arxiv.org/html/2608.20368#bib.bib6)\] 和 TF‑IDF\[5 (https://arxiv.org/html/2608.20368#bib.bib7)\]。这些特征随后被输入到流行的机器学习模型中,即 SVM(支持向量机)、随机森林和神经网络。在我们新收集的 11,673 篇学术文章上进行的实验结果表明,采用 SBERT 嵌入的神经网络达到 87.22% 的准确率,而 FastText 结合 SVM 则达到 91.12%,突显了文本信息在评估研究质量方面的价值。 虽然我们的二元框架(“好” vs. “不好”)提供了初步的筛选效用,但我们承认引用次数和撤回状态是不完美的代理指标。高引用论文可能包含错误,撤回的作品则包括欺诈性错误和诚实的错误。这种简化作为迈向更细致质量评估的务实第一步,并进行了边界案例分析。我们的贡献总结如下: - • 我们提供完整的超参数透明度,以确保方法的可重现性和公平比较。 - • 我们使用 t‑SNE 可视化特征空间,以揭示“好”与“不好”论文之间的可分性。 - • 我们应用 SHAP 来解释模型预测并识别关键的语言标记。 - • 我们分析错误案例,以突出二元分类的局限性并指导未来的改进。 ## 2 相关工作 ### 2.1 引用分析与机器学习 学术交流中的引用分析随着机器学习的最新发展而发生了变革。Hassan 等人 \[4 (https://arxiv.org/html/2608.20368#bib.bib8)\]使用双向 LSTM 处理全文文章,以 89% 的准确率对引用上下文进行分类,证明了深度学习的有效性。他们的研究表明,引用语义提供了比单纯引用次数更详细的信息。Pradhan 等人 \[10 (https://arxiv.org/html/2608.20368#bib.bib9)\]在此基础上,使用图神经网络检查引用网络,揭示知识传播中的复杂模式。基于这些框架,Ma 等人 \[8 (https://arxiv.org/html/2608.20368#bib.bib10)\]创建了一个基于 Transformer 的模型,通过使用论文元数据元素(例如,作者 h 指数、机构隶属关系)预测引用次数,以 0.81 的斯皮尔曼相关性优于传统指标。Joshi 等人 \[6 (https://arxiv.org/html/2608.20368#bib.bib11)\]进一步说明了这些方法在会议论文接收预测中的有用性,其中使用 15 个稿件属性的梯度提升树获得了 83% 的准确率。 ### 2.2 引用影响与排名系统 另一个重要的研究领域是创建可靠的论文排名方法。通过内容感知的引用网络加权,Krapivin 和 Marchese \[7 (https://arxiv.org/html/2608.20368#bib.bib12)\]首次提出的 Focused PageRank 将论文排名质量提高了 37%。在他们最近的工作中,Basuki 等人 \[1 (https://arxiv.org/html/2608.20368#bib.bib13)\]通过结合机器学习和引用功能分类来预测引用次数,将预测误差降低了 22%。他们的工作表明,在评估学术影响力时,区分不同引用类型(例如,方法论采纳与批判)至关重要。所有这些研究都强调了从基本的引用次数转向更复杂的、内容感知指标的重要性。 ### 2.3 撤回模式与传播 对已撤回文章的分析为学术诚信问题提供了重要见解。Silva 和 Bornemann \[12 (https://arxiv.org/html/2608.20368#bib.bib2)\]发现,由于数据库更新延迟,32% 的撤回论文在被撤回后仍被引用。在 Silva 和 Dobranszki \[13 (https://arxiv.org/html/2608.20368#bib.bib1)\]的工作中,他们后来的分析发现,生物医学领域高被引出版物(超过 100 次引用)中有 18% 包含撤回通知。Van der Vet 和 Nijveen \[15 (https://arxiv.org/html/2608.20368#bib.bib14)\]对错误引用的传播进行了深入调查,发现学术网络中的“引用复制”行为导致了 68% 的不当引用。这些发现凸显了需要自动化技术来识别和标记已撤回文献的必要性。 ### 2.4 引用功能与语义分析 Teufel 等人 \[14 (https://arxiv.org/html/2608.20368#bib.bib15)\]通过创建将引用划分为 12 种功能类型(如比较、批判和方法论采纳)的详尽标注方案,为当代引用分析奠定了基础。随后的机器学习应用得以实现,例如 Hassan 等人 \[4 (https://arxiv.org/html/2608.20368#bib.bib8)\]发现撤回论文使用方法论引用功能的频率高出 40%。当前学术交流研究的前沿代表是将这些语义属性与网络分析和预测建模相结合。 ### 2.5 我们的动机 虽然引用分析和撤回追踪在先前工作中取得了显著进展,但我们的研究填补了三个重要的空白:(1)先前的研究未能充分整合对撤回论文的语言分析与引用网络特征;(2)大多数模型依赖元数据而未利用全文语义模式;(3)很少有解决方案提供适用于编辑工作流的实时分类。我们的方法通过独特地结合深度学习、引用图特征和 SBERT 嵌入 \[11 (https://arxiv.org/html/2608.20368#bib.bib3)\]来填补这些空白。 不同于 Hassan 等人 \[8\]需要全文分析,我们的标题/摘要方法支持可扩展的预筛选。虽然算法组件是成熟的,但将它们应用于使用最少文本的撤回预测是新颖的,解决了 Van der Vet 等人 \[14\]所指出的编辑工作流需求。 表 1:总结数据集组成。 ## 3 方法论 ### 3.1 概述 在我们提出的框架中,工作流程包括五个关键计算步骤:(1)**数据收集**:使用来自 IEEE Xplore、Scopus 和 Springer Nature API 的结构化查询聚合学术文章。(2)**预处理**:包括基于 DOI 的原始文本分词、停用词去除和去重。(3)**特征提取**:使用统计方法(例如 TF‑IDF 向量)和语义表示(例如句子嵌入)将非结构化文本转换为多维特征空间。(4)**模型训练**:采用交叉验证和监督学习技术来优化多个分类器架构。最后,(5)**质量分类**:将训练好的模型应用于未见过的输入,生成概率预测并将其分类为不同的质量组。 参见图注图 1:整个数据集中出版商的分布(11,673 篇文章)。IEEE 是主要来源(35%),其次是 Springer(25%)。Hindawi 较高的比例(总计 20%)反映了其在撤回论文中的过度代表(占撤回的 42%)。 ### 3.2 收集的数据集 我们收集了一个包含 11,673 篇学术文章的语料库,平均分配在已撤回(“不好”)和高影响力(“好”)类别之间,以确保可靠的模型训练。6,000 篇高影响力出版物是根据期刊影响因子(IF > 2.0)和引用次数(超过 100 次引用)选择的,以确保学术影响力。它们来源于 IEEE Xplore、Scopus 和 Springer Nature API。5,673 篇撤回作品是从撤回观察数据库中检索的,摘要则取自 Hindawi 和出版商网站。两个类别都选择包含来自不同时期的出版物,以保持时间上的平衡。这确保了数据集代表了数十年来一致的引用模式和研究活动。表 1 (https://arxiv.org/html/2608.20368#S2.T1) 显示了收集的数据集统计数据。同时,图 1 (https://arxiv.org/html/2608.20368#S3.F1) 显示了出版商的分布。这里,收集的论文(“好”和“不好”类别)以 IEEE(35%)、Springer(25%)和 Hindawi(20%)为主,ACM 和其他来源占剩余的 20%。 撤回原因包括数据错误(25%)、抄袭(28%)和伪造(32%)。仅包含 2010 年至 2023 年间发表的出版物,使用 DOI 匹配过滤掉重复项,并确保学科多样性(计算机科学和工程学)以减少偏差。在文本中发现了细微的差异:撤回论文较短(平均 1,659 个字符),可能是由于撤回后修订,而高影响力论文平均每篇摘要 1,842 个字符。 自动化筛选可能会对非常规研究不利。部署应该增强——而不是替代——人类判断,尤其是对于跨学科投稿。 然后,我们从好论文和撤回论文中生成词云。确实,在排除常见停用词(模型、系统、方法、数据等)后,存在许多语言差异。如图 2 (https://arxiv.org/html/2608.20368#S3.F2) 所示,在高影响力(卓越)文章中使用诸如“网络”、“算法”和“数据集”等主导短语,表明非常重视方法论的严谨性、量化、验证和假设驱动的探索。可信的学术工作的特点是目标明确、结果可重复、研究方法结构化。有趣的是,“算法”和“数据集”等术语强调了可量化结果和科学准确性的重要性。 另一方面,撤回的出版物大量使用诸如“控制”、“组”、“时间”、“努力”、“水平”和“效果”等词,这些词表示模糊或过于笼统的语言,通常与方法论缺陷相关。“患者”和“控制”的频繁使用可能表明主题特定的偏见或辩解,这在被撤回的生物医学研究中很常见。使用笼统、非特定的短语(“结果”、“分析”)可能表明方法缺乏特异性,这可能与已知会导致撤回的数据重用有关。 参见图注(a)高影响力论文 参见图注(b)已撤回论文 图 2:高影响力(左)与已撤回(右)论文的词云比较。高质量出版物中更大的词汇多样性(68% 的独特词汇,而撤回论文为 52%)突显了其相当的深度。相比之下,撤回论文经常重复使用相同的单词(例如,“组”、“水平”),这可能反映了仓促或不诚实的写作风格。这些统计和视觉差异展示了词语选择如何成为学术诚信的早期信号,从而激发使用自然语言处理(NLP)方法来筛选潜在问题的投稿。 ## 4 基准测试 ### 4.1 实验设置 在基准测试中,我们利用
相似文章
研究论文的哪些部分最能揭示其研究方法?来自图书馆与信息科学的证据
本文提出了一种基于全文内容分段的组合策略,用于自动分类学术论文中的研究方法。在来自图书馆与信息科学期刊的标注语料库上的实验表明,方法信息分布不均匀,中后段具有更高的区分能力。
用于引文功能分类的大型语言模型
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。
这个引用是否切题?
本文评估了大型语言模型在法律文件中验证引用支持的能力,发现虽然模型能有效检测错误案件的引用,但在精确页码引用上存在困难,常常混淆主题相关性和精确支持。
使用递归神经张量网络检测生物医学文本中的推测性语言
本文探讨了利用分布式句子表示自动检测生物医学文章中的推测性语言,将递归神经张量网络和段落向量与支持向量机及其他基线方法进行比较,发现RNTN取得了最佳F1分数0.885。
ResearchQA:科学论文中基于引用的问答基准测试
ResearchQA是一个新基准,包含来自八个领域494篇开放获取论文的6,211个单论文问答对,旨在通过要求可验证引用并在证据不足时支持基于理由的拒绝,来评估基于引用的问答能力。