学术论文推荐中对话搜索引擎的权威偏见

arXiv cs.AI 论文

摘要

本文研究了在学术论文推荐中作为对话搜索引擎使用的LLMs中的权威偏见,发现LLMs对基于作者声誉和引用等权威信号的论文表现出显著偏好,而去偏措施仅部分有效。

arXiv:2609.00248v1 Announce Type: new 摘要:大型语言模型(LLMs)越来越多地被用作学术文献的对话搜索引擎,但尚未有因果性测试来检验它们是基于内容还是权威信号来评判论文。我们研究了权威偏见:即基于作者声誉、发表场所和引用而非内容的系统性论文偏好。在保持标题和摘要不变的情况下,我们通过三个反事实条件(原始、翻转、增强)在八个LLMs(五个开源权重和三个前沿闭源权重)上变化权威元数据,设置在上下文、单轮、top-1推荐场景中。我们的实验表明,权威偏见显著且具有方向性,在不同模型间差异明显,并且只能通过提示层面的去偏措施部分解决。我们还记录了言行不一现象:去偏指令抑制权威提及的速度远快于权威驱动的翻转,因此表面审计系统性低估了行为偏见。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:59

# 对话式搜索引擎学术论文推荐中的权威性偏差  
来源:https://arxiv.org/html/2609.00248  
Parsa Ghazvinian  
所属机构:乔治亚州立大学  
邮箱:[bampel@gsu\.edu](mailto:)  

Anjila Budathoki  
所属机构:田纳西大学诺克斯维尔分校  
邮箱:[rsunderraman@gsu\.edu](mailto:)  

Benjamin M\. Ampel  
所属机构:乔治亚州立大学  
邮箱:[pghazvinian1@student\.gsu\.edu](mailto:)  

Rajshekhar Sunderraman  
所属机构:乔治亚州立大学  
邮箱:[abudatho@vols\.utk\.edu](mailto:)  

Yi Ding  
所属机构:田纳西大学诺克斯维尔分校  
邮箱:[yding@utk\.edu](mailto:)  

###### 摘要  
大型语言模型(LLMs)越来越多地被用作学术文献的对话式搜索引擎,但尚未进行过因果测试来验证它们判断论文是基于内容还是基于权威信号。我们研究了*权威性偏差*:即系统性地偏好基于作者声望、发表场所和引用量而非内容的论文。在保持标题和摘要不变的情况下,我们在八种LLM(五种开源权重和三种前沿闭源权重)的上下文相关、单轮、Top-1推荐设置中,通过三个反事实条件(原始、反转、增强)改变权威性元数据。实验表明,权威性偏差显著且具有方向性,在不同模型间差异明显,且仅能通过提示层面的去偏来部分解决。我们进一步记录了*言行不一差距*:去偏指令抑制权威性*提及*的速度远快于抑制权威性驱动的*翻转*,因此表面审计系统性地低估了行为偏差。111代码:https://github.com/jinaduuthman/Authority-Bias-In-Conversational-Search-Engine 数据:https://huggingface.co/datasets/uthmanjinadu/authority-bias-paper-recommendation  
††∗通讯作者。  

## 1 引言  
大型语言模型(LLMs)正迅速成为学术文献发现的主要接口。基于GPT-4等系统构建的工具(包括ChatGPT、Perplexity、Elicit和Semantic Scholar的AI功能)接受自然语言研究查询,并返回带有理由的综合推荐。与Google Scholar或PubMed等基于关键词的检索引擎不同,这些系统充当*推荐者*:它们内部对候选论文进行评分,选择一篇或多篇进行高亮,并阐述选择理由。这种转变将大部分相关性判断从研究者委托给模型,隐含假设模型评估的是论文*内容*而非*权威信号*——作者h指数、发表场所声望、引用量和机构隶属关系,这些在网页爬取的训练数据中普遍存在。  

这一假设是脆弱的。Algaba等人(2025)表明LLMs在生成参考文献时复制人类引用模式,并具有*增强*的引用偏差;Barolo等人(2025)发现LLMs在识别物理学顶尖专家时倾向于资深、高引用研究者;Howell等人(2025)报告了LLM驱动的同行评审中类似的声望高于能力的模式。这些发现涵盖了不同的LLM介导的学术任务,并呼应了马太效应(Merton, 1968)以及Tomkins等人(2017)关于人类评审者的实验证据。然而,这些研究均未针对对话式搜索中的论文推荐,也未建立权威性元数据的*因果*效应:相关性设计无法排除权威性与内容之间的混淆(Pearl, 2009),而单维度操作仍无法确定效应是否普遍存在于各信号中,或是否特别通过某一线索(如机构隶属关系)起作用。  

我们通过内容控制的反事实审计填补了这一空白。借鉴劳动力市场审计研究的对应测试逻辑(Bertrand和Mullainathan, 2004)以及为LLMs形式化的反事实偏差框架(Huang等人, 2025),我们保持论文内容(标题和摘要)不变,仅改变权威性元数据。由此,任何推荐变化均可归因于权威性信号。为了将权威性分解为可测量的信号而非预设权重(科学计量指标所依赖的;Ioannidis等人, 2019),我们在三个模型上运行了15,000次试点实验,其中一篇论文的内容与10篇候选论文的元数据依次配对(正式称为1:N翻转设计,见§4.3)。使用z分数标准化预测变量的逻辑回归(Hosmer和Lemeshow, 2000;Menard, 2004)和优势分析(Budescu, 1993;Azen和Budescu, 2003)得出五个权威性维度的稳定排序——发表场所声望、作者中位h指数、作者最高h指数、引用量和机构隶属关系,这些共同定义了后续使用的复合权威性得分。  

然后我们构建了三个内容一致的条件来测试不同的机制:*原始*(真实元数据)、*反转*(高↔低权威性互换,测试模型是否遵循元数据而非内容)和*增强*(中等论文配对精英元数据,测试对虚高声望的吸引力)。将这些条件与八种LLM——五种通过Ollama提供的开源权重模型,以及三种通过提供商API访问的前沿闭源权重模型(gpt-5.4、gemini-3-flash-preview、claude-sonnet-4-6)——结合,三种指令变体(中性、轻度去偏、强去偏)和覆盖25个计算机科学主题的250个查询,共产生17,898个解析观测值。任务始终为上下文相关、单轮、Top-1推荐:论文在提示中提供而非检索,每个查询是单次无状态请求,模型返回一篇论文。  

此析因设计解决了三个研究问题(§4.1):权威性偏差是否存在且是否具有剂量响应性(RQ1),变化是否系统性地向更高权威性移动(RQ2),以及提示层面的去偏是否缓解该效应(RQ3)。  

#### 我们的贡献如下:  
1. 一种内容控制的反事实方法,用于因果测量LLM论文推荐中的权威性偏差,其中权威性权重通过翻转试点运行的经验逻辑回归和优势分析得出,而非任意设定。  
2. 跨开源和闭源LLM的析因基准:17,898次论文推荐评估,涵盖八种模型(五种开源权重和三种前沿闭源权重,来自七个开发组织)、三种反事实条件、三种指令变体和25个计算机科学主题,公开发布以供重用。  
3. 两个此前未在LLM推荐器中分离的诊断现象:(i)*言行不一差距*,即去偏指令显著减少理由中的权威性语言,但对决策中权威性驱动的翻转减少较少;(ii)*前沿层反效果*,即轻度反权威提示*增加*三个来自独立供应商的前沿闭源权重模型的翻转率,同时减少较小层级消融实验和大多数开源模型的翻转率。  
4. 跨模型、信号和主题的实证偏差概况,确定发表场所声望(而非机构隶属关系)为主导权威性信号、开源-闭源权重易感性差距以及显著的跨主题异质性——否定了关于哪些声望维度驱动推荐偏差的常见假设(Howell等人, 2025;Tomkins等人, 2017)。  

## 2 相关工作  
#### 生成式搜索引擎。Aggarwal等人(2024)引入了生成式引擎优化(GEO),这是一个黑箱框架,内容创作者在源页面中注入SEO风格的线索——添加引用、统计数据、引文或权威性表述——以增强其在LLM合成答案中的可见性,报告在多领域基准测试中可见性提升高达40%。Puerto等人(2025)(C-SEO Bench)将此问题扩展到问答和产品推荐的对话场景,发现专门的C-SEO方法与传统SEO相比大多无效,并且随着更多采用者竞争,收益变为零和。这两条研究线都从内容创作者角度针对生成式搜索的可操作性。我们相反地测量系统固有的偏差,无外部操作。  

#### LLM声望和引用偏差。近期研究记录了LLM介导的不同学术任务中的声望效应:增强的引用复制(Algaba等人, 2025)、专家命名中资深/高引用偏好(Barolo等人, 2025)、机构驱动的同行评审评分(Howell等人, 2025),以及跨新闻、电子商务和论文选择的潜在发表场所偏好(Khan等人, 2026)。我们相反地针对*论文推荐*,使用内容控制的反事实,将权威性分解为五个经验加权信号,并与跨开源和闭源模型的提示层面去偏配对。  

#### 反事实偏差框架。反事实扰动已应用于LLM代码生成(Huang等人, 2025)、临床推理(Ghosh等人, 2025)以及基于提示缓解的参考选择(He, 2025);更广泛的公平性文献(Gallegos等人, 2024)集中于社会身份属性。我们将该框架适应于*认知权威性偏差*——对学术声望的偏差——并联合改变多个权威性信号,而非一次一个。  

#### LLM排序器中的位置和流行度偏差。权威性偏差在结构上类似于协同过滤中的流行度偏差(Abdollahpouri等人, 2020)和列表式LLM排序中的位置偏差(Wang等人, 2024);Lichtenberg等人(2024)另外报告LLM推荐器在电影领域比传统系统具有*更低*的流行度偏差,暗示领域依赖性,这促使关注学术搜索,其中权威性信号是多维的,且公平性影响决定哪些研究被阅读和引用。  

#### LLM作为评判者的偏差。另一条研究线研究LLM评估答案质量时的偏差:审计和调查记录了包括位置、冗长性和权威性效应在内的判断偏差(Ye等人, 2025;Gu等人, 2024),并且Chen等人(2024)比较人类和LLM评判者,发现两者都易受影响。该工作扰动一个候选答案并询问质量判断是否稳健;我们相反地研究推荐,保持论文内容固定,仅改变分解为五个经验加权信号的权威性元数据。  

## 3 问题形式化  
#### 任务形式化。我们将基于LLM的学术论文推荐形式化为列表式Top-1选择(Sun等人, 2023):给定一个无序候选集,模型选择一个项目。等价地,这是一个多类分类问题,其中每个候选论文是一个类别。设ϕ表示一个大型语言模型。给定一个研究查询q∈Q和n篇学术论文的候选集Pq={p1,...,pn},模型产生推荐rq=ϕ(q,Pq,I)∈Pq,其中I是指定推荐标准的指令变体。  

#### 论文表示。每篇论文分解为pi=(Ci,Mi),其中Ci=(titlei,abstracti)是内容,Mi=(ai,vi,si)是权威性元数据,包括作者档案ai={(namej,hj,affj)}j=1ki(作者j的全名、h指数和机构隶属关系)、发表场所vi和引用量si。  

#### 权威性得分。我们定义复合权威性得分α(pi)∈[0,1]为五个维度的加权和——发表场所声望、作者中位h指数、作者最高h指数、引用量和机构隶属关系声望:  
α(pi)=∑d=15wd⋅x^i,d (1)  
其中x^i,d是维度d在其论文研究主题内的最小-最大归一化值,权重wd在§4.3中经验得出。  

#### 权威性偏差。我们将*权威性偏差*定义为模型推荐对权威性元数据的敏感性,在内容不变的情况下:当仅元数据改变时推荐发生变化,根据定义是偏差的证据。这种敏感性算作偏差,因为选择仅基于权威性而改变,违背了内容相关性请求且未披露;如果用户明确请求权威感知的结果(如高度引用的作品),则不算偏差,但此案例我们不研究。在整篇论文中,我们使用*易感性*作为此属性的规范术语,*抵抗性*作为其反义词;两者都指由翻转率和增强率共同测量的行为(§4.7):  
AuthorityBias(φ)=Prq∼Q[φ(q,Pqorig,I)≠φ(q,Pqmanip,I)] (2)  
其中Pqmanip∈{Pqflip,Pqboost}表示具有操纵元数据的候选集(§4.4)。

相似文章

LLM谄媚中权威层级的机制视角

arXiv cs.CL

本文通过受控的医学问答设置研究LLM中的权威偏见,揭示模型以与感知权威成比例的分级方式覆盖正确答案。该效应局限于一个关键的后层,其中正确答案表征被主动擦除。

默认极化:LLM 内容策展中的推荐偏差审计

arXiv cs.CL

本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。

偏好数据中引用的作用

arXiv cs.CL

本文研究了在科学问答中人类和LLM偏好中引用的作用,发现人类偏好多样但较少的引用,而LLM尽管缺乏源访问,却表现出更强的与引用相关的偏好。

谁的事实能赢?知识冲突下大语言模型的信息源偏好

arXiv cs.CL

本论文通过研究检索增强生成中不同信息源的偏好,探究大语言模型如何处理知识冲突。研究发现大语言模型倾向于选择经机构验证的信息源,但这些偏好可通过重复而被逆转,论文提出了一种方法来减少重复偏差同时保持一致的信息源偏好。