像科学家一样思考?LLM生成研究方法的结构化研究

arXiv cs.CL 论文

摘要

本研究探讨了当仅提供研究问题时,LLM如何推荐研究方法(数据集、模型、指标),发现LLM表现出强烈的提供者偏差,且相比实际论文所提出的方法范围要窄得多,这可能会缩小研究者的方法论搜索空间。

arXiv:2606.26130v1 公告类型:新 摘要:大型语言模型(LLM)越来越多地被用于指导研究方法,但它们在最小提示下默认的方法论倾向仍不清楚。在此,我们为GPT-5.1、Gemini 3 Pro和DeepSeek-V3.2提供来自1000篇近期arXiv计算机科学论文的LLM提取的研究问题,并将生成的方法建议与论文导出的实验清单进行比较。由于我们仅提供研究问题,所测量的差异反映的是初始建议,而非这些建议的最优性。我们从两个来源提取结构化方法特征,将其映射到共享分类法中,并量化多个分类维度(包括模型提供者、数据集任务类型和评估指标类型)的差异。最强烈的不平衡出现在提供者选择上,Jensen-Shannon散度约比其他分类维度大3-5倍。其他/学术中单次出现的模型被低估了23-24个百分点,而复用的学术/社区模型则被轻微高估(4-6个百分点)。LLM还总体上提出了更窄的方法范围:模型实体的有效数量从1,232缩减到59-96,且LLM之间的秩相关性(0.55-0.68)通常高于LLM与论文之间的相关性(0.33-0.56),因此这些失真很大程度上在模型间共享。流行度基线、BM25检索校准以及论文级相似性测试证实,输出是针对查询的响应,但经过更窄选项集的过滤。因此,依赖LLM建议而不进行交叉验证的研究人员可能面临方法论搜索空间缩小、集中于默认选项的风险。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:14

# 像科学家一样思考?对LLM生成的研究方法的结构性研究  
来源:https://arxiv.org/html/2606.26130  

Francesca Carlon¹,²,![[未标注图片]](https://arxiv.org/html/2606.26130v1/panda2.png) 0009-0004-2152-2745 (https://orcid.org/0009-0004-2152-2745) & Brecht Verbeken¹,² 0000-0002-7506-3298 (https://orcid.org/0000-0002-7506-3298) & Vincent Ginis¹,²,³ 0000-0003-0063-9608 (https://orcid.org/0000-0003-0063-9608) & Andres Algaba¹,² 0000-0002-0532-3066 (https://orcid.org/0000-0002-0532-3066)  
¹Data Analytics Lab, Vrije Universiteit Brussel, Pleinlaan 5, 1050 Brussels, Belgium  
²imec-SMIT, Vrije Universiteit Brussel, Pleinlaan 9, 1050 Brussels, Belgium  
³School of Engineering and Applied Sciences, Harvard University, Cambridge, Massachusetts 02138, USA  

###### 摘要  
大型语言模型(LLMs)越来越多地被用于指导研究方法论,然而在最小提示条件下它们的默认方法论倾向仍不明确。本文中,我们使用LLM从1000篇近期arXiv计算机科学论文中提取的研究问题,分别提示GPT-5.1、Gemini 3 Pro和DeepSeek-V3.2,并将生成的方法论建议与基于论文的实验清单进行比较。由于我们只提供研究问题,测量到的差异反映了初始建议,而非这些建议的最优性。我们从两个来源提取结构化方法特征,将其映射到共享分类体系中,并量化跨多个分类体系维度(包括模型提供者、数据集任务类型和评估指标类型)的差异。最强烈的不平衡出现在提供者选择上,詹森-香农散度约为任何其他分类体系维度的3–5倍。其他/学术类单次出现模型被低估了23–24个百分点,而重复使用的学术/社区模型被略微高估(4–6个百分点)。LLM总体上还建议了范围窄得多的方法:有效模型实体数量从1,232收缩到59–96,并且LLM间秩相关(0.55–0.68)通常超过LLM到论文的相关性(0.33–0.56),因此这些扭曲大多在各模型间共享。流行度基线、BM25检索校准和论文级相似性测试确认输出是针对查询的特定响应,但经由较窄选项集过滤。因此,依赖LLM建议而不进行交叉检查的研究人员可能面临将其方法论搜索空间缩窄至更集中默认的风险。  

††脚注文本:![[未标注图片]](https://arxiv.org/html/2606.26130v1/panda2.png) 通讯作者:[email protected] (https://arxiv.org/html/2606.26130v1/mailto:[email protected])  

*关键词*:AI科学家 ⋅ 大型语言模型 ⋅ 研究方法论 ⋅ 科学学 ⋅ 科学计量学  

## 1 引言  

参见图注  

图1:研究设计概述。  
我们将三个LLM的方法论建议(每个仅用研究问题提示)与1000篇近期arXiv计算机科学论文(涉及LLM相关主题)的基于论文的参考清单进行比较。对每篇论文,GPT-5.1提取实际使用的数据集、模型和评估指标(即基于论文的参考清单),并从标题、摘要和全文生成单一研究问题。然后GPT-5.1、Gemini 3 Pro和DeepSeek-V3.2各自仅从该问题提出数据集、模型、指标和简短流水线。标准化实体名称分析使用每个来源的完整1000篇论文输出,而分类和匹配论文分析则使用相关图注和表格中报告的较小分类或共享论文子集。该设计在故意稀疏的、仅以研究问题为输入的条件下隔离了首轮推荐行为。  

大型语言模型(LLMs)正越来越多地融入科学工作流程,不仅作为写作助手(Lund等人,2023 (https://arxiv.org/html/2606.26130#bib.bib9);Jain和Jain,2024 (https://arxiv.org/html/2606.26130#bib.bib4)),还作为可能重塑更广泛科学实践的工具(Musslick等人,2025 (https://arxiv.org/html/2606.26130#bib.bib36))。研究人员现在咨询LLM用于论文反馈(Liang等人,2024 (https://arxiv.org/html/2606.26130#bib.bib24))、研究思路和假设生成(Si等人,2025 (https://arxiv.org/html/2606.26130#bib.bib7);Baek等人,2025 (https://arxiv.org/html/2606.26130#bib.bib13);Qi等人,2023 (https://arxiv.org/html/2606.26130#bib.bib12))、知识综合和文献引导的研究支持(Liao等人,2024 (https://arxiv.org/html/2606.26130#bib.bib3);Skarlinski等人,2024 (https://arxiv.org/html/2606.26130#bib.bib25)),以及实验设计,涵盖自然语言处理、计算机视觉、化学、材料科学、社会科学等领域(Liao等人,2024 (https://arxiv.org/html/2606.26130#bib.bib3);Jain和Jain,2024 (https://arxiv.org/html/2606.26130#bib.bib4);Liang等人,2024 (https://arxiv.org/html/2606.26130#bib.bib24);Si等人,2025 (https://arxiv.org/html/2606.26130#bib.bib7);Baek等人,2025 (https://arxiv.org/html/2606.26130#bib.bib13);Qi等人,2023 (https://arxiv.org/html/2606.26130#bib.bib12);Boiko等人,2023 (https://arxiv.org/html/2606.26130#bib.bib26);Skarlinski等人,2024 (https://arxiv.org/html/2606.26130#bib.bib25);Hewitt等人,2024 (https://arxiv.org/html/2606.26130#bib.bib45);Manning等人,2024 (https://arxiv.org/html/2606.26130#bib.bib46);Kusumegi等人,2025 (https://arxiv.org/html/2606.26130#bib.bib28);Fortunato等人,2018 (https://arxiv.org/html/2606.26130#bib.bib35))。近期证据表明,科学产出本身已经在LLM采纳的驱动下发生变化(Kusumegi等人,2025 (https://arxiv.org/html/2606.26130#bib.bib28))。多个系统现在自动执行研究周期中的较大环节,从自主想法生成和科学发现(Lu等人,2026 (https://arxiv.org/html/2606.26130#bib.bib1);Yamada等人,2025 (https://arxiv.org/html/2606.26130#bib.bib33);Mitchener等人,2025 (https://arxiv.org/html/2606.26130#bib.bib15);Gottweis等人,2025 (https://arxiv.org/html/2606.26130#bib.bib47);Elbadawi等人,2024 (https://arxiv.org/html/2606.26130#bib.bib18))到多智能体研究工作流(Li等人,2024 (https://arxiv.org/html/2606.26130#bib.bib2);Villaescusa-Navarro等人,2025 (https://arxiv.org/html/2606.26130#bib.bib10);Schmidgall等人,2025 (https://arxiv.org/html/2606.26130#bib.bib5);Li等人,2025 (https://arxiv.org/html/2606.26130#bib.bib8);Wang等人,2024 (https://arxiv.org/html/2606.26130#bib.bib14);Gridach等人,2025 (https://arxiv.org/html/2606.26130#bib.bib6);Liu等人,2025a (https://arxiv.org/html/2606.26130#bib.bib16))、文献筛选(Delgado-Chaves等人,2025 (https://arxiv.org/html/2606.26130#bib.bib32))以及研究代码或方法论生成(Gandhi等人,2025 (https://arxiv.org/html/2606.26130#bib.bib17);Novikov等人,2025 (https://arxiv.org/html/2606.26130#bib.bib34))。这些发展引发的科学学问题并非是LLM回答得是否正确,而是它们在默认情况下会使哪些方法变得显著。当研究人员向前沿模型咨询关于数据集、模型或评估指标的初次指导时,由此产生的建议定义了一个初始的方法选项菜单,可能锚定后续决策(Musslick等人,2025 (https://arxiv.org/html/2606.26130#bib.bib36);Fortunato等人,2018 (https://arxiv.org/html/2606.26130#bib.bib35))。如果该菜单被系统性地压缩或扭曲,它可能在更深入文献综述开始之前就重塑某一领域内实验设计的分布。已有研究表明,来自人类反馈的强化学习会降低输出多样性(Kirk等人,2023 (https://arxiv.org/html/2606.26130#bib.bib21);Luo等人,2026 (https://arxiv.org/html/2606.26130#bib.bib22)),LLM生成的学术成果会再现不平等的科学认可和引文模式(Liu等人,2025b (https://arxiv.org/html/2606.26130#bib.bib29);Algaba等人,2025b (https://arxiv.org/html/2606.26130#bib.bib31), a (https://arxiv.org/html/2606.26130#bib.bib11);Mobini等人,2026 (https://arxiv.org/html/2606.26130#bib.bib30)),并且LLM使用可能加剧下游评估和创造性任务中的基准饱和与同质化(Ballon等人,2026 (https://arxiv.org/html/2606.26130#bib.bib27);Bommasani等人,2022 (https://arxiv.org/html/2606.26130#bib.bib40);Doshi和Hauser,2024 (https://arxiv.org/html/2606.26130#bib.bib41);Anderson等人,2024 (https://arxiv.org/html/2606.26130#bib.bib42))。这些担忧之所以重要,是因为科学界已在面临引文不平等和可重复性方面的已知压力(Nielsen和Andersen,2021 (https://arxiv.org/html/2606.26130#bib.bib23);Ioannidis,2005 (https://arxiv.org/html/2606.26130#bib.bib19);Open Science Collaboration,2015 (https://arxiv.org/html/2606.26130#bib.bib20);Camerer等人,2016 (https://arxiv.org/html/2606.26130#bib.bib44))。然而,目前尚不清楚LLM如何重塑当代研究领域中的方法论注意力,以及当前沿模型作为初次中间人时,哪些特定的提供者、模型家族、基准和评估标准会变得更为或较不显著。  

在此,我们研究一个典型案例:关于LLM相关主题的近期计算机科学论文,其中研究者尤其可能使用LLM来选择基准、模型家族和评估标准。我们进行了大规模实证比较,将GPT-5.1(在GPT-5系统卡中记录,精确模型ID见A.3节 (https://arxiv.org/html/2606.26130#A1.SS3))(Singh等人,2025 (https://arxiv.org/html/2606.26130#bib.bib57))、Gemini 3 Pro(Google DeepMind,2025 (https://arxiv.org/html/2606.26130#bib.bib79))和DeepSeek-V3.2(DeepSeek-AI等人,2025 (https://arxiv.org/html/2606.26130#bib.bib74))的方法论建议,与从1000篇近期arXiv论文中提取的基于论文的方法论清单进行对比。对每篇论文,我们提取作者使用的数据集、模型和评估指标(称为基于论文的参考清单),从论文的标题、摘要和全文生成单一研究问题,然后要求每个LLM仅从该问题提出数据集、模型、指标和简短流水线。我们将建议与基于论文的清单在三个层面进行比较:单个实体频率、宽泛类别分布以及方法共同出现的模式(图1 (https://arxiv.org/html/2606.26130#S1.F1))。完整的方法论细节见附录A (https://arxiv.org/html/2606.26130#A1)。消融实验和稳健性分析见附录B (https://arxiv.org/html/2606.26130#A2)和C (https://arxiv.org/html/2606.26130#A3)。  

我们发现两个规律。首先,差异集中在模型提供者上。所有三个LLM都过度加权了一小部分主要商业提供者,而在更广泛的重新分组下,主要缺失在于单一定义的长尾,而非重复使用的学术或社区模型。其次,LLM生成对问题敏感但急剧压缩的方法菜单。有效模型多样性收缩了13–21倍,LLM间秩相关超过LLM到论文的相关性,许多精确名称缺失退化为家族或提供者层面的匹配。我们将差异解释为相对于基于论文的参考语料库的方法论注意力重新分布,而非偏离规范最优值,并且我们在故意稀疏的体制下(每个模型仅看到研究问题)研究这些效应。流行度基线、BM25校准和打乱论文测试排除了通用模板化。前沿LLM确实对问题做出响应,但使用的是较窄且更集中于提供者的词汇。  

## 2 结果  

我们根据分类器是仅看到实体名称[EL]还是也看到生成的流水线[WP]来分类分析。第2.2节 (https://arxiv.org/html/2606.26130#S2.SS2)使用[EL]基线,而第2.3节 (https://arxiv.org/html/2606.26130#S2.SS3)以及C.7节 (https://arxiv.org/html/2606.26130#A3.SS7)–C.8节 (https://arxiv.org/html/2606.26130#A3.SS8)中的分类分析使用[WP]。实体名称召回率(C.7节 (https://arxiv.org/html/2606.26130#A3.SS7))和归一化阈值敏感性(C.10节 (https://arxiv.org/html/2606.26130#A3.SS10))与分支无关。C.11节 (https://arxiv.org/html/2606.26130#A3.SS11)包含与分支无关的提取、归一化和新引入性审计,以及[WP]的分类标签审计;提供者可靠性被认为适用于[EL]和[WP]两者,因为提供者标签在分支间几乎不变(B.1节 (https://arxiv.org/html/2606.26130#A2.SS1))。基于归一化实体名称的图形(图2 (https://arxiv.org/html/2606.26130#S2.F2)和3 (https://arxiv.org/html/2606.26130#S2.F3))在分类之前,不带有分支标签。提供者在两种设置中仍然是差异最大的维度(图4 (https://arxiv.org/html/2606.26130#S2.F4)a, 表E3 (https://arxiv.org/html/2606.26130#A5.T3))。共现矩阵在[EL]分支中不可用,因为它仅存储聚合类别计数。  

### 2.1 基于问题但压缩的方法菜单  

表1:LLM使用大幅减少的模型和指标词汇,同时相对保留更多数据集多样性。  
根据确定性归一化实体清单计算,采用默认模糊聚类(T=90)对每个来源的1000篇论文。唯一实体名称、总提及次数以及唯一名称与总提及次数的比率,针对基于论文的参考清单和每个LLM。总提及次数超过论文数,因为每篇论文可能包含每种类型的多个实体。  

我们首先在基于论文的参考清单与LLM建议之间比较单个数据集、模型和评估指标名称。除非另有说明,实体名称分析使用确定性归一化,随后在默认阈值T=90下进行模糊聚类(A.6节 (https://arxiv.org/html/2606.26130#A1.SS6)),表1 (https://arxiv.org/html/2606.26130#S2.T1)按实体类型总结了词汇量和总提及次数。最清晰模式是词汇压缩。LLM使用的模型词汇量比参考清单小一个数量级(表1 (https://arxiv.org/html/2606.26130#S2.T1)和5 (https://arxiv.org/html/2606.26130#A3.T5)),覆盖度相应地稀疏。大约五分之四的参考数据集和指标,以及十分之九的参考模型,不被任何LLM建议(图2 (https://arxiv.org/html/2606.26130#S2.F2)a–c)。这些词汇总数是流水线特定估计,而非精确计数,因为盲审发现提取的共识度中等(模型间ICC(2,1)=0.469),表E11 (https://arxiv.org/html/2606.26130#A5.T11)中的完美精度/召回率/F1仅适用于共识子集。LLM还引入了许多语料库新实体,因此它们同时遗漏了完整论文清单中存在的实体,并替换了目标文献中未使用的备选方案。  

参见图注  

图2:LLM仅覆盖基于论文的参考清单中实体的一小部分,且通过显著更集中的分布实现。  
面板使用每个来源1000篇论文的归一化实体清单(A.6节 (https://arxiv.org/html/2606.26130#A1.SS6))。(a–c) 参考清单中被0、1个LLM覆盖的实体份额。

相似文章

衡量人类与LLM研究思路之间的差距

Hugging Face Daily Papers

本研究论文引入了一个框架,用于衡量人类生成与LLM生成的研究思路之间的分布差距,发现LLM思路集中在特定的机会模式与综合方法上,而人类思路则更为多样化。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。