推理是否能提升大型语言模型的心理深度?这取决于评判者是谁。

arXiv cs.LG 论文

摘要

研究调查了LLM-as-a-Judge评估者是否能可靠地评估LLM生成故事的心理深度,揭示了人类偏好的异质性,而评判者则基于表层特征对推理输出表现出偏见。

arXiv:2609.13773v1 公告类型:新 摘要:LLM-as-a-Judge评估者越来越多地用于评分开放式生成,但评判者在其开发集上与人类评分的相关性可能无法保证有效测量,当输出高度匹配且人类偏好主观时。我们通过短篇小说中的心理深度研究了这一失败模式。七名人类读者和一个在原始标量心理深度量表数据集($\rho = 0.646$)上选择的LLM评判者集合评估了60对来自GPT-5 vs.\ GPT-4o和DeepSeek-R1 vs.\ DeepSeek-V3的盲测、提示匹配的故事对。人类偏好未显示普遍的推理优势:GPT-5略微优于GPT-4o(60.0--62.9\%),而DeepSeek-R1落后于V3(42.9\%),读者间一致性接近偶然(Krippendorff's $\alpha = 0.070$),读者内一致性和重复权重模式表明结构化异质性而非随机反应。相比之下,评判者在89.0\%的维度级比较和60对中59对的总体PDS上偏好推理输出,在所有五种评估者配置中一致,其分数与表层特征如句子长度和词汇多样性相关。这些结果表明,开发集性能不足以证明在偏移分布上的部署有效性,点估计评判者可能掩盖主观人类评估中的异质性。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:52

# 推理能力是否能提升大语言模型的心理深度?取决于评判标准  
来源:https://arxiv.org/html/2609.13773  

\\workshoptitle  

我们能否信任评判者?构建可靠的语言模型评估体系  

一合王 联署单位:清华大学 法布里斯·Y·哈勒-加拿大 联署单位:洛杉矶综合医院 萨拉·霍斯拉维 联署单位:加州大学洛杉矶分校 泽伊内普·塞纳汉·耶尔德兹 联署单位:加州大学洛杉矶分校 阿米特·萨海 联署单位:加州大学洛杉矶分校 彭南云 联署单位:谷歌  

###### 摘要  

大语言模型评判系统正日益用于评估开放式生成内容,但评判者在开发集上与人类评分的相关性,并不能保证在输出高度相似且人类偏好具有主观性时的有效测量。本文通过短篇小说的心理深度研究探讨这一失效模式。七位人类读者与基于原始心理深度量表数据集(ρ=0.646)选定的大语言模型评判集成体,评估了60对来自GPT-5与GPT-4o、DeepSeek-R1与DeepSeek-V3的盲测提示匹配故事对。人类偏好未显示普遍的推理优势:GPT-5仅略优于GPT-4o(60.0%–62.9%),而DeepSeek-R1则落后于V3(42.9%),读者间一致性接近随机水平(克里彭多夫α=0.070),但读者内一致性与重复权重模式表明存在结构性异质性而非随机回应。相比之下,评判者在89.0%的维度级比较和59/60对聚合PDS中均倾向于推理型输出,且该倾向在所有五种评估配置中保持一致,其评分与句子长度和词汇多样性等表层特征相关。这些结果表明,开发集性能不足以证明在分布偏移情况下的部署有效性,且点估计评判者可能掩盖主观人类评估的异质性。  

## 1引言  

自动评判系统已用于选择检查点、比较系统并日益提供训练信号;大语言模型评判方法使这一过程可扩展,但其有效性取决于上下文而非内在属性。成对评判虽可能与人类偏好一致,却也可能放大评估偏差(Zheng等,2023;Liu等,2025;Jeong等,2025)。现有研究已记录位置偏好、冗长偏好、自我偏好与不一致性效应(Li等,2025;Panickssery等,2024;Stureborg等,2024;Wang等,2024)。然而更基本的问题仍待探讨:一个在选定数据上与人类高度一致的评判者,在输出高度相似且人类偏好具有主观性的偏移分布中部署时,是否仍保持有效性?  

主观创意评估是这一问题最为突出的领域。以流畅性为中心的指标奖励格式规范的文本,却忽略了小说中真正重要的特质(Gómez-Rodríguez与Williams,2023;Lu等,2026),而大语言模型输出中看似创造性的内容可能只是对文学风格的表层模仿(Chakrabarty等,2024),因此评判者可能评分的是文字打磨度而非深度。与此同时,读者在主观任务上的分歧往往反映任务模糊性与价值观差异,而非标注噪声(Clark等,2021;Sandri等,2023;Kirk等,2024)。评估此类文本的评判者不仅需考察总体一致性,更需检验其是否保留了人类判断的*分布特征*。  

我们通过短篇小说的*心理深度*研究此问题,采用心理深度量表(PDS)(Harel-Canada等,2024),该量表衡量真实性、共情度、参与度、情感激发与叙事复杂性。作为测试案例,我们使用推理增强模型(如GPT-5与DeepSeek-R1),这些模型通常通过数学、编码与事实基准进行评估(OpenAI等,2024a;Snell等,2024),但其推理导向的后训练很少在开放式创意生成中被检验。我们构建了60对盲测提示匹配故事对,涵盖三大前沿对决:两种推理强度设置下的GPT-5与GPT-4o,以及DeepSeek-R1与DeepSeek-V3。每对故事由七位人类读者与基于原始PDS数据集(ρ=0.646)选定的大语言模型评判集成体进行评估。我们探究:为人类评分一致性而选择的PDS评判者能否复现人类读者对前沿故事对的偏好?这些偏好如何随模型家族、维度及读者而变化?哪些故事属性与评判者评分相关?  

我们的结果揭示显著不匹配,并贡献三项发现:(1)审计表明,具备可观开发集相关性的PDS评判者在人类读者随机判断且按模型家族分歧的情况下,产生近乎统一的偏推理信号(89.0%维度级比较、59/60对聚合PDS,跨所有五种配置);(2)证据显示评判者评分追踪句子长度与词汇均匀性等表层特征,为偏差提供可能机制;(3)分布分析表明读者分歧具有结构性,点估计评判者无法表征其被选以近似的目标。  

## 2研究设计  

#### 自动评估器设置  

我们采用标量评分评估器而非直接成对训练的评判者,因为原始PDS数据集提供具有强标注者一致性的标量监督,使我们能构建校准少样本提示并在部署前与人类评分比较配置。遵循Harel-Canada等(2024),流程使用DSPy实施结构化输出控制(Khattab等,2023)并保留多角色提示策略(Salewski等,2023)。使用原始97篇故事数据集及其人类标注,我们将数据划分为20%示范池与80%选择集,通过对PDS评分向量应用k-means聚类从示范池选取代表性少样本示例(Su等,2022),并使用选择集比较Llama 3.1 70B、Llama 3.3 70B与Qwen3.5-397B配置在不同示范数量与思维链提示下的表现(Grattafiori等,2024;Qwen团队,2026)。无单一配置在所有维度表现最佳,因此我们构建异质集成体,将每个PDS维度分配给其最优配置。该集成体达到ρ=0.646,优于所有单一模型配置及Harel-Canada等(2024)的零样本PDS评估器(ρ≈0.51,使用GPT-4o)。由于同一80%分割既选择配置又提供此相关性,ρ=0.646为开发集估计,反映了实践中评判者通常调谐与重用的方式。推理时,每篇故事在1-5分独立评分;维度级偏好由更高路由分数得出,聚合PDS偏好由五个路由分数均值决定,完全平局时各故事得0.5分(附录B)。  

#### 部署集:前沿故事对  

原始PDS评估器基于人类故事与2023年时期大语言模型生成内容校准,其质量差距足以产生强标注者共识(α≈0.72);我们将其部署在难度显著更高的分布上。我们精选20个前提,为角色发展提供上下文框架同时保留叙事开放性:15个来自r/WritingPrompts,限于模型训练数据截止日期后发布、按历史得票排序并经质量手动筛选的帖子;5个来自Reedsy。每个前提生成三组提示匹配对:DeepSeek-R1与DeepSeek-V3、GPT-5(自动强度)与GPT-4o、GPT-5(高强度)与GPT-4o,共60对400-600词故事。所有故事使用统一零样本故事写作模板生成,仅对字数限制进行有限家族特定措辞调整(附录D)。DeepSeek-R1是V3的强化学习升级版,为我们提供最接近的推理导向后训练锚点(Guo等,2025;DeepSeek-AI等,2025);GPT对为模型级对比(Singh等,2025;OpenAI等,2024b)。这些是比较生态相关性而非推理能力的清洁消融实验,我们使用“推理输出”作为模型标签而非因果归属。  

#### 人类评估  

我们将Harel-Canada等(2024)框架调整为盲测成对协议;机构审查委员会认为该研究豁免。七位来自英语与心理学系的本科生读者在五个PDS维度与定制Label Studio标注界面(Tkachenko等,2020-2025)上接受培训。对60对故事,两篇故事随机顺序并排呈现,页面顶部显示PDS评分标准定义,读者提供六项强制选择判断:五个PDS维度各一项及一项总体偏好,无平局或置信度选项。这产生7×60×6=2520项成对偏好判断及112条读者自由文本理由。为监控标注质量,我们记录每对完成时间,进行留一读者稳定性分析,并实施研究后调查;招聘、薪酬与诊断见附录E。  

#### 分析  

人类偏好区间来自按对决×标准分组的独立截距逻辑混合模型,logit P(y_ir=1)=β_0+u_i+v_r,其中前提对i与读者r为交叉随机截距;18个区间为逐点无多重性调整。我们报告弗莱斯κ与克里彭多夫α(Fleiss,1971;Krippendorff,2011)作为一致性摘要,以及逐读者逻辑回归和维度至总体科恩κ以表征读者权重模式;七位读者条件下这些为探索性分析。为探究表层关联,我们测量长度、句子长度矩、MATTR、MTLD及Llama 3.1 70B下的困惑度。完整结果见附录A与C。  

## 3结果  

(图1:人类偏好随模型配对与维度变化;大语言模型评判者未体现此变化。(a)人类对推理模型故事的偏好及95% GLMM逐点区间;虚线标记随机水平。(b)大语言模型评判者对推理模型故事的偏好(60对汇总)。实条为推理胜出;斜线段将每个精确平局各0.5分归于推理故事;标签显示均分比率,括号内为原始平局数。聚合PDS为五个维度分数平均,区别于人类总体偏好问题。)  

#### 评判者近乎统一偏推理;读者并非如此  

在五个PDS维度中,集成体在300项逐对逐维度比较(平局均分)中,89.0%倾向于推理模型故事(图1b),范围从叙事复杂性的82.5%到参与度的95.8%。在聚合PDS上,60对中有59对选择推理故事:所有40个GPT家族对,且尽管读者倾向V3,DeepSeek对中仍有19/20对。相比之下,人类读者在2100项维度级投票中给推理故事58.0%,在420项总体偏好投票中给55.2%。此偏差非集成构建假象:所有五种单独评判配置均偏好推理模型,汇总均分比率从77.5%到96.3%(附录B)。  

#### 人类偏好取决于模型家族与维度  

人类偏好在不同模型家族间分化(图1a)。尽管推理故事获得55.2%总体偏好票,但此总体数据掩盖了家族级分歧:读者在自动(60.0%,95% CI [52.6, 69.5])与高强度(62.9%,[55.9, 72.7])推理设置下均略偏好GPT-5胜过GPT-4o,而DeepSeek-R1落后于DeepSeek-V3(42.9%,[33.7, 50.9]),该区间包含随机水平。同样分化出现在PDS维度:GPT-5对在情感维度持续高于50%,尤其情感激发(70.7%)与共情度(68.6%),而R1对V3呈现混合效应,在参与度不受青睐(39.3%,[29.6, 46.6])却在情感激发(61.4%)与叙事复杂性(58.6%)受青睐。个体读者从强烈偏推理(读者7,80.0%)到偏基线模型(读者1,36.7%),因此汇总的55.2%掩盖了家族与读者层面变异(附录A)。  

#### 群体一致性低;读者异质性具结构性但为探索性  

读者间一致性低:克里彭多夫α=0.070,原始成对一致性(53.8%)仅略高于随机预期的50%(附录A)。相较于Harel-Canada等(2024)使用相同标准在大差距项目中报告的α≈0.72,此一致性急剧下降。我们的前沿故事对质量更接近,低一致性可能反映标准对相近对区分度有限、读者主观性或噪声。质量检查减少但未消除标注失败担忧:读者每对耗时中位数108-418秒且节奏稳定,移除任何单一读者仅改变汇总比率2-4个百分点(附录E)。逐读者回归、维度至总体κ与自由文本理由显示重复维度权重模式,

相似文章

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

大规模推理模型(尚)不是多语言潜在推理器

arXiv cs.CL

本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。