前沿大型语言模型的响应漂移

arXiv cs.CL 论文

摘要

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。

arXiv:2607.20454v1 公告类型:新 摘要:所有前沿大型语言模型(LLM)都表现出响应漂移——即输出偏离经过专家验证的参考结果——然而,这种漂移的幅度和结构尚未通过系统性的人类评估加以表征。在此,我们报告了一项全面交叉评估,其中47位来自不同地理区域的参与者在盲测条件下各自评估了10个前沿LLM在62个多领域问题上的表现,共获得29,140个独立评估。每个模型都存在漂移,但漂移幅度差异显著:八个模型收敛于统计上无法区分的上限(78-81%偏差),而两个模型实现了较低的偏差(47-49%)。漂移概况在六个领域和62个问题上各不相同,上限模型之间的两两相关性超过r=0.85。自动相似度指标仅能解释不到2%的人类判断差异。这些发现表明,响应漂移在前沿LLM中普遍存在,其结构因领域和问题而异,并且只能通过以人为中心的评估来获取。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:16

# 前沿大语言模型中的响应漂移 来源:https://arxiv.org/html/2607.20454 Mohammed Aledhari数据科学系,北德克萨斯大学,丹顿,TX 76207,美国mohammed\.aledhari@unt\.eduAli Aledhari数据科学系,北德克萨斯大学,丹顿,TX 76207,美国这些作者对这项工作贡献相同Fatimah Aledhari数据科学系,北德克萨斯大学,丹顿,TX 76207,美国这些作者对这项工作贡献相同Gowtham Venkat Eathamokkala数据科学系,北德克萨斯大学,丹顿,TX 76207,美国这些作者对这项工作贡献相同Mohamed Rahouti计算机与信息科学系,福特汉姆大学,纽约,NY 10458,美国这些作者对这项工作贡献相同###### 摘要 所有前沿大语言模型 \(LLMs\) 都表现出响应漂移——生成的输出偏离了专家验证的参考答案——然而,这种漂移的幅度和结构尚未通过系统性的人类评估得到刻画。本文报告了一项全交叉评估,47名来自不同地理区域的参与者均在盲测条件下评估了十个前沿大语言模型在所有62个多领域问题上的表现,共获得29,140次独立评估。每个模型都存在漂移,但漂移幅度差异显著:八个模型收敛于一个统计学上难以区分的上限(78–81%的偏差),而两个模型实现了更低的偏差(47–49%)。漂移特征在六个领域和62个问题上各不相同,上限模型之间的两两相关性超过r=0.85r=0.85。自动相似性度量对人类判断的方差解释率不足2%。这些发现表明,响应漂移在前沿大语言模型中普遍存在,在结构和领域及问题上具有依赖性,并且只能通过以人为中心的评估来揭示。 尽管前沿大语言模型(LLMs)的能力迅速提升[6 (https://arxiv.org/html/2607.20454#bib.bib1),7 (https://arxiv.org/html/2607.20454#bib.bib2),16 (https://arxiv.org/html/2607.20454#bib.bib3)],一个基本问题仍然未被充分探索:当由人类专家而非自动基准进行评估时,这些系统的响应有多忠实?现有评估主要集中在狭窄的任务领域——数学问题求解[15 (https://arxiv.org/html/2607.20454#bib.bib4),33 (https://arxiv.org/html/2607.20454#bib.bib5)]、代码生成[10 (https://arxiv.org/html/2607.20454#bib.bib6)]或对话偏好[41 (https://arxiv.org/html/2607.20454#bib.bib7)]——未能提供全面性能的完整图景。许多成熟的基准现在已经饱和,多个模型在诸如大规模多任务语言理解基准(MMLU)[15 (https://arxiv.org/html/2607.20454#bib.bib4)]等数据集上的准确率超过90%,限制了它们区分前沿系统的能力[40 (https://arxiv.org/html/2607.20454#bib.bib8)];最近的人类最终考试基准[32 (https://arxiv.org/html/2607.20454#bib.bib31)]旨在将自动评估的难度推向极致,进一步突显了这一饱和挑战。训练数据污染进一步混淆了解释[1 (https://arxiv.org/html/2607.20454#bib.bib9)]。整体评估框架如语言模型整体评估(HELM)[5 (https://arxiv.org/html/2607.20454#bib.bib10)]、Chatbot Arena[8 (https://arxiv.org/html/2607.20454#bib.bib11)]、AlpacaEval[11 (https://arxiv.org/html/2607.20454#bib.bib12)]、MT-Bench[41 (https://arxiv.org/html/2607.20454#bib.bib7)]、Arena-Hard[24 (https://arxiv.org/html/2607.20454#bib.bib44)]和WildBench[26 (https://arxiv.org/html/2607.20454#bib.bib45)]推动了该领域的发展,而细粒度事实评估方法如FActScore[28 (https://arxiv.org/html/2607.20454#bib.bib13)]提高了特定生成任务的精度评估。然而,这些方法依赖于自动指标、LLM作为评判者的范式或两两偏好设计——尽管像方差分解或绝对评分这样的个别元素在先前工作中存在,但没有任何现有研究将它们结合在一个全交叉的人类评估中,从而同时实现跨模型的每问题相关性分析和绝对保真度测量。因此,在排行榜上报告的性能特征与领域知情的人类评估者所感知的模型输出保真度之间存在一个关键差距。我们将模型响应与专家验证参考文献的系统性偏差称为*响应漂移*,将自动感知质量与人类感知质量之间的脱节称为*保真度差距*(图1 (https://arxiv.org/html/2607.20454#S0.F1)a):在自动基准上看似可比的模型,当训练有素的人类评审者根据专家验证的参考文献评估其开放式响应时,可能会有显著差异[27 (https://arxiv.org/html/2607.20454#bib.bib14),37 (https://arxiv.org/html/2607.20454#bib.bib15)]。刻画响应漂移——其普遍性、幅度以及对模型、领域和问题的依赖性——需要能够捕捉跨不同认知领域开放式生成中渐进质量差异的评估设计,而不仅仅是二元正确性或相对偏好。

本文通过一项大规模的完全交叉人类评估来应对这一挑战。四十七名来自不同地理区域的参与者,在盲测条件下,各自评估了十个前沿大语言模型——涵盖独立组织并代表专有和开放权重系统——的所有62个标准化问题,共获得29,140次独立评估(图1 (https://arxiv.org/html/2607.20454#S0.F1)b;模型详情见方法和补充表S1)。这62个问题跨越六个能力领域:推理与语言理解、数学问题求解、编码与软件开发、对话能力、安全与伦理考量以及特定领域专业知识。所有模型均通过其默认的基于网页的界面进行访问,以模拟真实用户条件;这一设计选择优先考虑生态效度,但引入了部署层面的混杂因素,我们将在讨论部分加以审视。每个响应都根据专家验证的参考答案按五点李克特量表进行评分,我们将响应保真度量化为与完全一致性的归一化偏差(方法)。关键的是,这个指标捕捉的是评估者对模型响应在多大程度上忠实保留了*特定*参考内容的感知;它不评估绝对正确性,因为开放式问题可能允许多个与任何单一参考不同的有效响应。因此,高偏差表明与一个专家验证的答案存在偏差,不一定意味着低质量(见讨论)。

我们的核心发现是,*所有*被评估的前沿模型都表现出显著的响应漂移——偏离专家验证的参考答案——但这种漂移的幅度和结构在不同模型、问题和领域之间存在显著差异。大多数模型聚集在一个狭窄的性能带内(78–81%的偏差),在统计学上无法区分,形成了一个收敛的保真度上限,而两个模型实现了显著更低的偏差(47–49%)。然而,即使是这些高保真度模型,在评估的几乎一半维度上也偏离了专家参考。模型身份解释了保真度分数中超过一半的总方差,证实模型选择——而非问题难度或评估者变异性——是漂移幅度的主要决定因素。这个上限在所有六个领域中都持续存在,但漂移特征不同:在一个领域表现出色的模型可能在另一个领域失败,而问题层面的层级差距范围从0到73个百分点。独立计算的自动自然语言处理相似性度量对人类保真度判断的方差解释率不足2%,强调响应漂移是一种只能通过以人为中心的评估才能触及的现象。

参考图注(a)
参考图注(b)
图1:响应保真度问题与研究设计。a,激发本研究的保真度差距示意图。三位用户向同一个大语言模型(相同版本、种子和温度)提交相同问题,但与由≥2位领域专家验证的金标准专家参考相比,却收到质量各异的响应。高保真度响应保留了参考的内容、结构和准确性;部分保真度响应遗漏了关键细节;低保真度响应包含事实错误或幻觉内容。这种变异性对自动相似性度量几乎不可见,但人类评估者能清晰检测到。b,完全交叉重复测量研究设计。来自7个专业领域的47名地理分布广泛的参与者(北美18人,欧洲15人,亚洲12人,其他2人)在盲测条件下各自评估了所有10个前沿LLM的所有62个问题,得到47×10×62=29,140次独立评估,零流失率。响应根据专家验证的参考文献按5点Likert量表进行评分。保真度偏差 = \(5−Rating_{ijk}\)/4,其中0%表示完全保真,100%表示最大偏差。这62个问题跨越六个能力领域(每个10–12个问题),通过拉丁方设计随机化呈现顺序,评分者校准达到组内相关系数(ICC(2,1))= 0.84。

## 结果
### 所有前沿模型都存在响应漂移,但幅度差异显著
每个被评估的前沿模型都显著偏离了专家验证的参考答案,确认响应漂移是当前一代LLM中的普遍现象。然而,漂移幅度在不同模型之间差异显著,呈现出双峰结构。在29,140次评估中,响应保真度偏差——由人类评估者判断的、与专家验证参考答案的归一化距离(方法)——从47.0%(Claude)变化到80.5%(ChatGPT, DeepSeek, Qwen),相差33.5个百分点(pp)(Cohen's d=2.45,一种标准效应量,用于测量以合并标准差为单位的分组间分离程度[9 (https://arxiv.org/html/2607.20454#bib.bib22)];图2 (https://arxiv.org/html/2607.20454#Sx1.F2)a,b;表1 (https://arxiv.org/html/2607.20454#Sx1.T1))。然而,这个范围掩盖了一种明显的双峰分布。两个模型——Claude(47.0%,95%自助置信区间(CI)[42.7, 51.4])和Gemini(49.4%,CI [42.9, 55.8])——形成了一个高保真度层级,置信区间重叠且相互效应量可忽略(d=0.11)。其余八个模型聚集在一个2.9个百分点的条带中,介于77.6%(Llama)和80.5%(ChatGPT, DeepSeek, Qwen)之间。这八个上限模型在统计学上难以区分(Kruskal–Wallis H=9.18, p=0.24,一种用于检测组间差异的非参数检验;单因素方差分析(ANOVA)F(7,488)=1.26, p=0.27;补充表S6),而两个层级之间的对比则很大(Cohen's d=1.89;补充表S7)。为了提供等价性的正面证据,而非仅仅依赖不显著性,我们应用了双单侧检验(TOST)程序[22 (https://arxiv.org/html/2607.20454#bib.bib16)](方程5 (https://arxiv.org/html/2607.20454#Sx3.E5)),等价界限为Δ=5 pp(见方法)。在上限模型之间的所有28个两两比较中,均落在等价区域内(每对两个单侧检验的p<0.05),确认了上限内部差异小于预先指定的最小感兴趣效应量。在更严格的界限(Δ=3 pp)下,28对中有24对(85.7%)仍然达到等价;四个不等的对涉及最极端的上限模型(Llama at 77.6% vs. ChatGPT, DeepSeek, or Qwen at 80.5%)。相比之下,高保真度对比上限的对比则很大。

参考图注(a)
参考图注(b)
图2:跨领域的保真度偏差与整体模型排名。a,领域×模型保真度偏差,显示所有10个评估模型在六个能力领域各自的偏差百分比(较低的值表示较好性能)。单元格以连续绿-红色阶着色,其中绿色表示低偏差(高保真度),红色表示高偏差(低保真度);粗体值表示每个领域中表现最佳的模型;最右列显示总体偏差。黄色边框将两个高保真度模型(Claude 47.0%, Gemini 49.4%)与八个上限模型(77.6–80.5%)分开。底行的领域均值显示安全性具有最低的平均偏差(68.8%),领域知识具有最高(79.6%)。每个单元格n=47位评估者;620个模型-问题组合。b,所有六个基准上的整体保真度偏差,模型按从最佳(最低偏差)到最差排序。水平条按性能层级着色:绿色 = 好(<60%),橙色 = 中等(60–80%),红色 = 差(>80%)。40%、60%和80%处的虚线垂直参考线标记层级边界。Claude(#1, 47.0%)和Gemini(#2, 49.4%)与其余八个模型明显分离,后者形成介于77.6%和80.5%之间的紧密聚类。数值是跨n=62个问题的问题加权均值;95%自助CI报告于表1 (https://arxiv.org/html/2607.20454#Sx1.T1)。

用户选择哪个模型比具体提出的问题或谁来评估响应更为重要。在聚合的620单元格矩阵上的双因素ANOVA将保真度总方差的52.4%归因于模型身份(η²=0.524),16.5%归因于问题难度,31.1%归因于残差(表2 (https://arxiv.org/html/2607.20454#Sx1.T2), (A))。拟合至全参与者级别数据(29,140次观测;方程4 (https://arxiv.org/html/2607.20454#Sx3.E4))的线性混合效应模型[3 (https://arxiv.org/html/2607.20454#bib.bib19)]得出一致但更细粒度的分解:模型的方差比例为0.41,问题的ICC为0.14,参与者的ICC为0.09,0.36归因于观测级别残差(表2 (https://arxiv.org/html/2607.20454#Sx1.T2), (B))。条件R²为0.64,边际R²为0.41[29 (https://arxiv.org/html/2607.20454#bib.bib18)]。两种分析均确认模型选择是保真度的首要决定因素。领域级别方差分解显示模型η²范围从0.464(编码)到0.807(推理),报告于补充表S5;完整的62问题×10模型的偏差矩阵出现在补充表S4。

为了将上限的大小置于背景中,我们指出,在均匀随机评分(1–5)下,期望偏差为50%。因此,八个上限模型在78–81%的偏差水平远远低于这个基线,对应的隐含均值Likert评分为1.8–1.9(介于“完全不忠实”和“大部分不忠实”之间)。两个高保真度模型实现了隐含评分3.0–3.1(“部分忠实”)。这个比较是示意性的而非推断性的,因为随机评分和系统性评估涉及不同的认知过程;此外,偏离单个参考不一定意味着事实不正确,因为模型可能产生与特定专家参考不同的有效响应(见讨论)。自助排名分析(10,000 [...]

相似文章

一些大型语言模型表现出一致的风险态度

arXiv cs.AI

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

谁在翻转?自模型与跨模型反论点揭示LLM答案的不稳定性

Hugging Face Daily Papers

本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。