偏好数据中引用的作用

arXiv cs.CL 论文

摘要

本文研究了在科学问答中人类和LLM偏好中引用的作用,发现人类偏好多样但较少的引用,而LLM尽管缺乏源访问,却表现出更强的与引用相关的偏好。

arXiv:2608.21376v1 Announce Type: new 摘要:许多NLP任务要求系统在输出中提供归属感——即对基础来源的引用。归属感作为对抗模型幻觉的堡垒,并作为用户验证模型输出可信度的手段。然而,尚不清楚人类和LLM在比较输出时如何评估引用,这是奖励建模和现代LLM后训练的核心过程。本文研究了在科学问答背景下,引用在人类评审员和四个开源LLM偏好中的作用,利用混合效应模型来调查引用对成对判断的影响。我们的主要发现包括:(1) 人类偏好更多样但整体较少的引用;(2) 尽管缺乏对来源的访问,LLM与人类相比表现出一些与引用相关的偏好,但这些偏好取决于数据和具体模型。我们进一步讨论了我们的发现对偏好数据收集的影响。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:09

# 引用在偏好数据中的作用
来源:https://arxiv.org/html/2608.21376
余浩¹,Hal Daumé III¹,Rachel Rudinger¹,William Walden²
¹马里兰大学,²约翰斯·霍普金斯大学
通讯作者:[[email protected], [email protected]](mailto:email@domain)

###### 摘要
许多自然语言处理任务要求系统在输出中提供*归属*——即引用基础来源。归属是抵御模型幻觉的屏障,也是用户验证模型输出可信度的手段。然而,在比较输出时,人类和大语言模型如何评估引用,这一核心过程对奖励建模和现代大语言模型后训练而言尚不明确。本文在科学问答情境下研究引用在人类评审和大语言模型偏好中的作用,利用混合效应模型探讨引用对成对判断的影响。关键发现包括:(1) 人类更偏好*更多样化*但*总体数量更少*的引用;(2) 尽管无法访问原始来源,大语言模型相比人类表现出更强的引用相关偏好,但这些偏好因数据和具体模型而异。最后,我们讨论了研究结果对偏好数据收集的启示。111代码与数据将在论文发表后公开。

引用在偏好数据中的作用
余浩¹,Hal Daumé III¹,Rachel Rudinger¹,William Walden²
¹马里兰大学,²约翰斯·霍普金斯大学
通讯作者:[[email protected], [email protected]](mailto:email@domain)

## 1 引言
成对偏好数据在大语言模型开发中发挥着至关重要的作用,既用于后训练Ouyanget al.(2022);Liet al.(2025),也用于评估Chianget al.(2024),使模型能够学习难以明确规范的行为,并实现高效的排名与评估。但我们为此付出了可解释性的代价:特定偏好的原因通常不为所知——甚至评估者自身也可能不清楚。这种可解释性对于理解人类和模型偏见至关重要,而这又是开发公平且稳健的奖励模型的必要条件Duboiset al.(2024);Wuet al.(2025);Bharadwajet al.(2025);Zhaoet al.(2025b);Gehrmann(2025)。  
图1:针对SciArenaZhaoet al.(2025a)中一个问题的一对带有引用归属的模型回复。我们使用混合效应模型来理解引用对人类和大语言模型对此类配对偏好的影响。

这一需求推动了一条新兴研究线,即推断偏好判断的可解释解释。许多工作采用“提议-验证”范式:候选解释被*提出*——例如通过大语言模型分析Findeiset al.(2025a);Zhonget al.(2024),或通过稀疏自编码器特征Movvaet al.(2025)——然后通过尝试从这些解释预测(人类或模型的)判断来*验证*。尽管这类工作很有价值,但忽略了大多数检索增强生成和深度研究应用的核心数据类别——即*带有引用*的长文本回复。具体而言,随着越来越多的人将AI作为科研助手——用于查找论文或回答学术问题——引用在信息检索任务中的重要性已超越传统网络搜索。  
在此工作中,我们提出:引用相关特征如何影响科学问答中的人类偏好?此外,由于大语言模型评审常作为人类专家标注的代理用于偏好标注,我们进而比较:大语言模型在成对评估回复时如何权衡引用?  
我们借鉴*混合效应模型*(MEMs;Gelman and Hill, 2014)来探讨这些问题,使用两个包含对带有引用支撑的模型回复进行成对判断的数据集(图1):SciArena(Zhaoet al., 2025a)和ResearchQA(Yifeiet al., 2025)。我们利用这些数据集的人类偏好,并设置大语言模型评审实验,以比较每个数据集上的观察效应。  
总体而言,我们发现:
(1) 人类评审倾向于偏好具有*更多样化*但*总体数量更少*引用的回复。
(2) 对四个开源大语言模型(Llama、Gemma、Qwen和Skywork)的实验表明,引用相关和非引用相关特征对大语言模型偏好的影响与它们对人类偏好的影响不同,凸显了潜在的大语言模型偏见。
(3) 在四个大语言模型评审中,我们发现它们表现出不同的相关性模式和引用偏好。  
我们讨论了这些发现的意义,期望能促使人们在偏好数据收集时更谨慎地对待引用。

## 2 通用设置
尽管SciArena(Zhaoet al., 2025a)和ResearchQA(Yifeiet al., 2025)都专注于科学问答场景,但其收集偏好的过程不同。我们在此讨论高级设置,更多细节见第3节和第4节。

#### 数据集选择标准
我们的分析需要满足三个条件的数据集。首先,回复必须包含引用。222我们发现许多*理应*满足此首要条件的偏好数据集并未满足。其次,每个查询必须有多个回复以进行成对比较。第三,因为我们希望比较大语言模型评审与人类的行为,每个回复对必须有明确的人类偏好投票,使我们能够对相同数据探测大语言模型评审偏好。经过对现有数据集的广泛搜索,这些要求将我们限制在两个选择:SciArena(12,249次比较)和ResearchQA(169次可用比较)。

#### 大语言模型推理实验
我们从四个大语言模型获取这些示例的偏好:Llama3.3-70B(Grattafioriet al., 2024)、Gemma3-27B(Teamet al., 2025)、Qwen3-30B(Yanget al., 2025)和Skywork-Critic-70B(Shiwenet al., 2024)。Skywork是专门训练作为生成式奖励模型,并因其在RAG-RewardBench(Jinet al., 2025)上的顶级排名而被选中,而其他三个则因其在开放权重模型中的普遍流行度而被选中,尽管它们并非明确训练作为奖励模型。为控制因呈现顺序引起的偏见,我们对提示中回复的两种可能顺序都运行了实验,从而为SciArena和ResearchQA分别产生12,249×2=24,498和169×2=338次判断。我们对两个数据集使用相同的评审提示(见下文)。333更多实验设置细节,参见附录A。

**大语言模型评审提示**
你是一位科学文献综合专家。你的任务是评估两个针对用户问题的、带有引用归属的AI生成回复的质量。评估两个回复的相关性、准确性、清晰度以及引用使用的恰当性。然后,选择最佳回复,输出(a)或输出(b)。
用户问题:{question}
输出(a):{response_a}
输出(b):{response_b}
哪个最佳,输出(a)还是输出(b)?
仅回答:“A”或“B”

#### 混合效应模型
混合效应模型是分层回归模型,包含随组变化的斜率和/或截距参数(*随机效应*)以及跨组共享的参数(*固定效应*)。MEMs广泛应用于可解释的数据分析Gelman and Hill (2007);McElreath (2018);Federicoet al.(2014);Ganttet al.(2020);Whiteet al.(2022);Sunet al.(2023);Sandovalet al.(2023);Benito-Santoset al.(2025)。  
遵循Bradley-Terry模型Bradley and Terry (1952),我们处理二元偏好作为因变量(**y**)在混合效应逻辑回归中:
logit(P(**y**=1|**u**)) = **Xβ** + **Zu**
其中**X**是预测变量矩阵;**β**是固定效应回归系数向量;**Z**是随机效应设计矩阵;**u**是随机效应向量,其中u_j ~ N(0, **G**),**G**为协方差矩阵;而**β**和**G**是待推断的参数。

#### 固定效应预测变量
我们为每个数据集考虑三个引用相关变量:引用多样性、引用数量、引用时效(仅SciArena)和引用不匹配(仅ResearchQA)。这些变量是引用偏见研究中研究的变量的子集(Wahleet al., 2025;Algabaet al., 2025;Fanget al., 2025),旨在比较封闭集合的引用,而非(完全开放的)引用选择(因为配对中的回复基于相同的查询和检索文档)。
引用多样性(C_D)捕获引用来源的多样性,通过香农多样性指数(即熵)衡量:-∑(i=1到n) p_i log₂(p_i),其中n是回复中唯一来源的数量,p_i表示归属于来源i的引用比例。低值表示多样性低(即回复仅由少数几个来源主导,被反复引用)。
引用数量(C_C)衡量回复中的引用数量。C_C和C_D用于测试关于引用*分布*的假设。
引用时效(C_A)[仅SciArena]捕获如图1所示的引用来源的平均发表日期,计算为avg(ln(2026 - y)),其中y是引用的发表年份。444我们应用对数变换,因为日期分布严重偏斜,79.67%的引用在2019年之后,中位数为2023年,众数为2024年。由于ResearchQA引用中没有日期信息,因此无法用于该数据集。
引用不匹配(C_M)[仅ResearchQA]捕获ResearchQA回复中行内引用与参考列表之间的差异。与SciArena使用作者-年份行内引用(如“Liet al. 2025”)不同,ResearchQA回复通常使用编号引用(如“[1]”、“[2]”),并在回复末尾附有参考列表。在少数情况下,行内引用与参考列表条目不匹配:要么行内引用在参考列表中没有对应条目,要么反之。为考虑评审者可能惩罚此类差异的可能性,我们计算不匹配引用的数量C_M。
为赋予这些通常与回复内容交织的引用相关效应以有意义的解释,除呈现顺序外,我们还控制了另外两个潜在混淆因素:
响应长度(R_L,以字符计)——偏好数据中常见的偏见来源Duboiset al.(2024);Parket al.(2024);Huet al.(2025)。
响应内容(R_C)衡量两个回复之间唯一内容的差异(移除行内引用后)。我们使用BERTScore(Zhanget al., 2020)精确度来捕获语义重叠:BERTScore(A, B)的精确度反映了回复A的内容被回复B覆盖的程度。我们定义A相对于B的唯一内容比例为:1 - Precision(A, B),其中值越高表示唯一内容越多。555我们使用roberta-large进行BERTScore计算。我们将每个连续预测变量表示为回复A(R_A)和回复B(R_B)在该变量上的z分数差值。没有固定效应预测变量显示多重共线性,方差膨胀因子(VIFs)<2。

#### 随机效应设计
考虑到两个数据集的差异(例如,生成回复所涉及的模型数量),我们分别为每个数据集指定一个最大随机效应结构Barret al.(2013)。然后,我们通过基于AIC的Akaike (1974)模型选择迭代消除随机效应来简化每个最大模型,以确保简洁并最小化过拟合Matuscheket al.(2017),对每组人类或大语言模型判断重复此过程。

#### 平均边际效应
我们报告总体水平平均边际效应Williams (2012);Arel-Bundocket al.(2024)。结果以胜率变化(ΔWin Rate)百分点(pp)显示:在预测变量每增加1个标准差时,R_A被选择的概率变化,对随机效应取边际效应。值越高表示(对于每个预测变量)R_A具有(a)更高的引用多样性,(b)更多的总引用量,(c)总体上更旧的引用(SciArena)或更多不匹配的引用(ResearchQA),(d)更长的响应,或(e)更多唯一内容。

## 3 案例研究:SciArena
对于SciArena(§3)和ResearchQA(§4),我们首先讨论数据的细节,这些细节如何影响我们的混合效应模型设计,以及我们试图用这些模型回答的研究问题。然后,我们讨论引用相关特征对人类偏好的影响观察,以及这与*非*引用相关特征影响的比较。最后,我们介绍对四个大语言模型评审的观察。

### 3.1 设置细节
#### 数据
SciArenaZhaoet al.(2025a)包含来自102位研究人员对针对科学查询的成对大语言模型生成回复的多数偏好...

相似文章

谁的事实能赢?知识冲突下大语言模型的信息源偏好

arXiv cs.CL

本论文通过研究检索增强生成中不同信息源的偏好,探究大语言模型如何处理知识冲突。研究发现大语言模型倾向于选择经机构验证的信息源,但这些偏好可通过重复而被逆转,论文提出了一种方法来减少重复偏差同时保持一致的信息源偏好。

这个引用是否切题?

Hugging Face Daily Papers

本文评估了大型语言模型在法律文件中验证引用支持的能力,发现虽然模型能有效检测错误案件的引用,但在精确页码引用上存在困难,常常混淆主题相关性和精确支持。