LLM辅助写作值得实证评估

arXiv cs.CL 论文

摘要

本文主张对LLM辅助写作进行实证评估,发现其与更集中的呈现、更广泛的引用以及健康信息学研究中更分布式的作者身份相关。

arXiv:2608.22124v1 发布类型:新 摘要:LLM辅助写作常被视为一个检测问题,因为它引发了关于清晰度、诚信、公平和评估的质疑。对69,209篇健康信息学论文的分析表明,其与更集中的呈现、更广泛的引用实践以及更全球分布的作者身份相关。这些模式并不能证明更好的科学,但它们支持根据学术质量和问责制而非工具使用来评估手稿。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:26

# LLM辅助写作值得实证评估
来源:https://arxiv.org/html/2608.22124
钟轩  
林丰毅  
隶属机构:美国纽约州纽约市威尔康奈尔医学院人口健康科学系  
张一业  
隶属机构:美国纽约州纽约市威尔康奈尔医学院人口健康科学系  
翁春华  
隶属机构:美国纽约州纽约市哥伦比亚大学生物医学信息学系  
彭一帆  
隶属机构:美国纽约州纽约市威尔康奈尔医学院人口健康科学系  
隶属机构:通讯作者。邮箱:[[email protected]](mailto:[email protected])

###### 摘要
LLM辅助写作常被视为检测问题,因为它引发了关于清晰度、诚信、公平性和评估的疑问。对69,209篇健康信息学论文的分析表明,它与更聚焦的呈现、更广泛的引用实践以及更全球化的作者分布相关。这些模式并不能证明科学质量更高,但支持根据学术质量和责任而非工具使用来评估稿件。

## 主要内容
大型语言模型(LLM)已迅速成为日常科研工作的一部分。研究人员使用它们来搜索、总结、起草、编辑、翻译和重组文本\[3 (https://arxiv.org/html/2608.22124#bib.bib3), 1 (https://arxiv.org/html/2608.22124#bib.bib4)\]。学术争论常常集中在LLM辅助写作是否可以被检测、披露、限制或与“真正的”学术研究分离。尽管关于透明度、作者身份、捏造内容、偏见和过度依赖的担忧很重要\[4 (https://arxiv.org/html/2608.22124#bib.bib5)\],但LLM辅助写作也可能改变研究人员交流的实际条件,特别是对于跨越语言、机构和学科工作的作者。因此,它们在科学写作中的作用是一个实证和社会问题,而不仅仅是技术问题。将LLM辅助写作主要视为检测问题,可能会忽略它可能如何重塑清晰度、引用实践、作者模式以及认可度。

问题不仅仅是LLM辅助写作是有益还是有害。科学写作长期以来一直依赖多种形式的帮助,例如导师、合作者、专业编辑、翻译、报告指南和期刊模板。LLM辅助写作为这个生态系统增添了新的辅助形式。它之所以不同于早期形式,是因为它可以大规模生成流畅的文本、总结文献、跨语言翻译,并且可能以难以察觉的方式引入错误或不受支持的断言。它们的影响可能取决于任务、用户、领域、制度环境以及人类监督的水平。

为了考察LLM辅助写作如何与科学交流相关,我们分析了69,209篇PubMed索引的健康信息学文章。我们将论文分为前LLM时代和后LLM时代,以ChatGPT在2022年底的公开发布作为实际分界线\[5 (https://arxiv.org/html/2608.22124#bib.bib1)\],并使用SciBERT分类器将后LLM论文分为LLM独立论文和LLM辅助论文\[2 (https://arxiv.org/html/2608.22124#bib.bib2)\]。然后,我们比较了各组之间的文献计量、语义、参考和作者元数据(图1 (https://arxiv.org/html/2608.22124#Sx1.F1))。结果表明,LLM辅助写作并非仅仅是低质量或不够严肃学术的标志。相反,它与更聚焦的呈现、更全面的相关工作引用以及更广泛的研究者参与相关。

参见标题图1:观察到的模式的总结。a–c,PubMed索引的健康信息学出版物结合了外部来源的元数据,并使用基于人类撰写和LLM重写摘要训练的SciBERT分类器分为前LLM、LLM独立和LLM辅助论文。d,与对照组相比,LLM辅助论文显示出更低的主题和语义分散度、更高的引用知识多样性、更高的全球代表性以及相似的可见度和影响力。

## 学术写作中的语义集中度
与后LLM时代的LLM独立论文和前LLM论文相比,LLM辅助论文在其主题和语义呈现上显得更为聚焦(图2 (https://arxiv.org/html/2608.22124#Sx5.F2)a-b)。每篇论文被分配的主题更少,其标题和摘要嵌入更接近这些主题的语义中心。尽管在更广泛的后LLM论文中也观察到了类似的趋势,但这种模式在LLM辅助组中最为显著。

这种集中性有多种解释。一方面,它可能反映了一份手稿在已建立的研究领域中定位更清晰。更聚焦的呈现可以帮助读者理解论文的贡献,将其置于现有工作中,并评估其相关性。通过鼓励符合学科惯例的语言,LLM辅助写作可能会提高清晰度、可发现性和可访问性,特别是对于跨越语言或制度边界的作者。

另一方面,LLM辅助写作可能会减少修辞多样性,并使论文之间的区别变得不那么明显。重要的是,接近领域语言的语义本身并不表示新颖性或缺乏新颖性。一篇论文可以在语义上接近领域规范,同时仍然包含新颖的方法、数据集、应用或实证结果;它也可以写得很流畅,但贡献有限。因此,问题不在于LLM辅助的科学写作是否变得更加集中,而在于最终的手稿是否继续传达具体、准确且实质上原创的贡献。

## 引用模式与知识广度
引用模式指向了另一个潜在变化的领域。LLM辅助论文比后LLM时代的LLM独立论文引用了更多的参考文献,并表现出更高的参考文献主题多样性(图2 (https://arxiv.org/html/2608.22124#Sx5.F2)c–e)。它们的参考文献目录也涵盖了更广泛的主题范围。

这种对比之所以重要,是因为LLM不仅仅用于润色文本。研究人员越来越多地将它们用作写作助手,以总结文献、识别相邻概念、生成搜索词和重组相关工作\[3 (https://arxiv.org/html/2608.22124#bib.bib3), 1 (https://arxiv.org/html/2608.22124#bib.bib4)\]。如果这些做法降低了探索邻近文献的成本,它们可能会扩大作者认为相关的论文范围。

然而,更广泛的检索并不等同于更好的选择。如果没有评估*相关性*的明确标准,访问更大一组候选参考文献可能会同时增加有意义的跨学科联系和仅与科学论证关系微弱的引文。因此,更广泛和更多样化的参考文献列表并不一定意味着更深层次的综合。引文可能是表面的、错位的,或者与它们所支持的论点仅松散相关。

这些局限并非LLM辅助写作独有。人类撰写的论文同样可能包含装饰性引文和不完整的文献综述。根据LLM的使用和验证方式,它们可能会放大、减少或保持这些现有实践不变。随着LLM辅助写作变得更加普遍,开发评估引文准确性、平衡性和相关性的自动化方法可能变得越来越重要。

## 作者构成与全球参与度
观察到的最大差异在于作者背景。与后LLM时代的LLM独立论文和前LLM论文相比,LLM辅助论文的第一作者中来自非英语环境的比例更高。它们还显示出来自中低收入经济体的代表性略高,以及更高水平的洲际合作(图2 (https://arxiv.org/html/2608.22124#Sx5.F2)f–h)。

一个合理的解释是,LLM可能有助于降低参与英语科学出版的一些障碍。英语仍然是索引生物医学研究的主要语言,非英语环境的研究人员通常在编辑、翻译和遵守国际出版规范方面面临额外成本。LLM可能通过提供按需语言帮助和帮助作者使手稿符合预期的科学体裁来减少这些限制。

然而,LLM辅助写作的潜在益处可能分布不均。获取高级写作助手的机会因研究人员和机构而异,不平等的机会可能带来新的优势形式。如果这些工具大幅减少了文献综述、起草、修改和手稿准备所需的时间,那么更有机会获得这些资源的研究人员可能能够更快地完成和提交工作。在竞争激烈的出版环境中,这些生产力优势可能会随着时间的推移而累积,可能扩大拥有不同资源水平的研究人员和机构之间的差距。相反,主要依赖传统写作过程的学者可能面临在速度和科学质量上进行竞争的日益增加的压力。因此,尽管LLM可能降低现有的一些出版障碍,但它们对科学参与公平性的整体影响仍不确定,并且可能取决于研究界如何分配获取这些工具的机会。

## 可见度与认可度
一个常见的担忧是LLM辅助写作可能产生质量较低的工作,从而获得较少的认可。可见度分析并不支持这种简单的预期(图2 (https://arxiv.org/html/2608.22124#Sx5.F2)i–k)。尽管LLM辅助论文的原始被引次数较低,但这主要是由于其发表日期较新,因此积累引用的时间较短。当在固定的发表后时间窗口内比较引文获取情况时,LLM辅助论文并未显示出较弱的早期引文获取。平均而言,它们也发表在影响因子高于后LLM时代LLM独立论文的期刊上。

这些发现涉及可见度和认可度,而非内在的科学质量。引文计数和期刊影响因子是科学价值的不完美指标,受到出版时间、领域规范、编辑选择和主题流行度的影响。

在这些局限性之内,观察到的模式并未表明LLM辅助工作早期认可度降低。这些模式在不同学科、时间范围和LLM作为写作辅助的使用方式下是否稳健,仍然是一个开放问题。

图2:分析组中的主题广度和语义集中度、参考文献列表规模和引用知识主题多样性、作者构成的语言、经济和国际合作特征以及出版可见度和引文影响力。a,每篇论文分配的本体主题。b,每篇论文到其分配的焦点主题中心点的平均欧氏距离。较低的值表示围绕主题中心的语义集中度更高。c,参考文献主题的Rao-Stirling多样性。d,焦点-参考文献的Rao-Stirling距离。e,每篇论文的参考文献数量。f,第一作者隶属于非英语环境的论文比例。g,通讯作者隶属于中低收入经济体的论文比例。h,有洲际合作的论文比例。i,24个月内的累积引文。j,期刊影响因子。k,被引次数。统计注释表示成对Mann-Whitney U检验。ns: p>0.05, *: p<0.05, **: p<0.01, ***: p<0.001, ****: p<0.0001。

## LLM辅助写作 vs 代理研究
本研究对LLM辅助科学写作进行了大规模的实证评估。一个关键的概念区分在于LLM辅助写作与人类智力合作(如共同作者或合作研究)之间。在此,我们关注的是不产生科学意图、不制定研究问题、不设计研究、不对结果有效性负责的LLM辅助写作。它们作为非代理工具,用于语言转换、总结和重组,而非参与认知决策。从这个意义上说,LLM辅助更类似于写作支持系统、统计软件或编辑服务,而非智力伙伴。然而在实践中,广泛使用LLM进行构思、文献综合或分析支持可能会模糊写作辅助与研究辅助之间的界限。这种模糊性强调了透明披露和仔细归属的重要性,同时在支持表达的工具和承担科学责任的代理之间保持概念上的分离。

总体而言,LLM辅助写作既不应被视为对科学交流固有有害,也不应被视为固有有益。相反,它代表了学术生产过程不断变化的一部分,其后果取决于它如何被采用、监管并融入现有学术实践。关于LLM辅助写作的讨论应从检测和道德分类转向评估它如何改变交流质量、引用实践、可及性和责任。未来的工作应优先考虑对科学写作中LLM使用更稳健和细致的测量,包括使用强度、目的(例如,编辑与起草)以及手稿开发阶段的差异。同时,编辑和科研评估应少关注是否使用了LLM辅助,多关注产生的学术成果是否准确、透明、有充分依据且在知识上负责任。

## 致谢
本研究得到了国家医学图书馆的支持,资助号为 R01LM014306, R01LM014344, R01LM014573(Y.P.)。

## 作者贡献
研究概念/研究设计,X.Z., Y.L., Y.P.;手稿起草或对重要学术内容进行手稿修改,X.Z., Y.P.;同意确保与工作相关的所有问题得到妥善解决,X.Z., Y.L., Y.P.;文献研究,X.Z., Y.L., Y.P.;实验研究,X.Z., Y.L., Y.P.;数据解释和统计分析,X.Z., Y.L., Y.P.;以及手稿编辑,X.Z., Y.L., Y.Z., C.W., Y.P.;阅读并批准提交的手稿最终版本,X.Z., Y.L., Y.Z., C.W., 和 Y.P.。

## 利益冲突声明
利益竞争:作者声明不存在利益竞争。

## 参考文献
- \[1\]A. Asai, J. He, R. Shao, W. Shi, A. Singh, J. C. Chang, K. Lo, L. Soldaini, S. Feldman, M. D’Arcy, D. Wadden, M. Latzke, J. Sparks, J. D. Hwang, V. Kishore, M. Tian, P. Ji, S. Liu, H. Tong, B. Wu, Y. Xiong, L. Zettlemoyer, G. Neubig, D. S. Weld, D. Downey, W. Yih, P. W. Koh, and H. Hajishirzi(2026)使用检索增强语言模型综合科学文献。Nature650(8103), pp. 857–863。外部链接: Document (https://dx.doi.org/10.1038/s41586-025-10072-4), Link (https://doi.org/10.1038/s41586-025-10072-4)被引用: 正文 (https://arxiv.org/html/2608.22124#Sx1.p1.1), 引用模式与知识广度 (https://arxiv.org/html/2608.22124#Sx3.p2.1)。
- \[2\]I. Beltagy, K. Lo, and A. Cohan(2019)SciBERT:面向科学文献的预训练语言模型。arXiv:1903.10676。外部链接: Document (https://arxiv.org/abs/1903.10676)

相似文章

为了内容而内容

Armin Ronacher

作者探讨了LLM如何影响编码和日常语言中的用词,发现LLM偏好的词汇在编程会话和Google Trends中出现的频率均有所增加,这引发了人们对人类开始采用LLM写作风格的担忧。