LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL 论文

摘要

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。

arXiv:2606.03043v1 Announce Type: new \n Abstract: LM作为裁判已成为标准做法,然而裁判之间高度一致,但与人类仅弱相关。我们检验这是否反映了共享信号或共享偏差,通过在标准LLM-as-judge堆栈上测量四个几何量:分数离散度、有效秩、与人类子空间的主角度,以及裁判与人类之间的堆叠相关性,所有测量均附有自举置信区间,涵盖四个社区构建的Indic数据集、八种Indic语言和41个LLM裁判。\n 在主观评分标准上,裁判使用的分数范围不足人类的一半($\\sigma_J / \\sigma_H \\approx 0.3$--$0.5$)。他们的评估轴几乎与人类正交,并且明显比人类彼此之间的距离更远($87^\\circ$--$89^\\circ$ 对比 $78^\\circ$--$81^\\circ$)。LLM间的一致性超过LLM与人类的一致性($r_{LL} \\approx 0.35$ 对比 $r_{LH} \\approx 0.27$--$0.32$)。\n 在具有可验证事实答案的评分标准上,相同的诊断结果回落至人类范围内(轴 $58.5^\\circ$;$r_{LH} = 0.519$)。微调和偏好优化恢复了离散度($0.32 \\rightarrow 1.08$),但轴几乎不变(仍为$87^\\circ$--$88^\\circ$)。只有基于小规模人类锚定集的后验校准才能同时改善所有四个社区健康评分标准,使经过校准的24B Indic裁判($r = 0.184$)领先于GPT-5.5($r = 0.123$),但仍未达到人类的可靠性(可验证评分标准上人类之间$r = 0.474$)。\n 我们认为只有当对裁判的分数子空间进行直接几何检查通过时,LLM间的一致性才应被视为人类对齐的证据;否则,这种共识反映的是坍塌子空间内的一致。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:36

# LLM 作为评判者的几何特性:为何内部 LLM 共识并非人类对齐
来源:https://arxiv.org/abs/2606.03043
查看 PDF(https://arxiv.org/pdf/2606.03043)

> 摘要:LLM 作为评判者已成为标准做法,然而评判者之间相互高度一致,但与人类的一致性却较弱。我们通过测量标准 LLM 评判堆栈在四个社区构建的 Indic 数据集、八种 Indic 语言和 41 个 LLM 评判者上的四个几何量来检验这反映的是共享信号还是共享偏差:评分分布范围、有效秩、与人类子空间的主角度,以及评判者与人类之间的堆叠相关性,均附带自助法置信区间。在主观评分标准下,评判者使用的评分范围不足人类的一半($\sigma_J / \sigma_H \approx 0.3$-$0.5$)。它们的评价轴与人类的几乎正交,且明显比人类彼此之间的轴距更远($87^\circ$-$89^\circ$ 对比 $78^\circ$-$81^\circ$)。LLM 内部一致性超过 LLM 与人类的一致性($r_{LL} \approx 0.35$ 对比 $r_{LH} \approx 0.27$-$0.32$)。在具有可验证事实答案的评分标准下,相同的诊断指标回落至人类范围(轴 $58.5^\circ$;$r_{LH} = 0.519$)。微调和偏好优化能恢复分布范围($0.32 \rightarrow 1.08$),但几乎不改变轴的方向(仍为 $87^\circ$-$88^\circ$)。只有在基于少量人类锚定样本的事后校准下,所有四个社区健康评分标准才共同得到改善,使得校准后的 24B Indic 评判者($r = 0.184$)优于 GPT-5.5($r = 0.123$),但仍未达到人类可靠性(在可验证评分标准下人类之间的 $r = 0.474$)。我们认为,只有当评判者评分子空间的直接几何检验通过时,LLM 内部一致性才应被视为人类对齐的证据;否则,这种一致性反映的是塌缩子空间内的共识。

## 提交历史

来自:Sourabrata Mukherjee [查看邮件](https://arxiv.org/show-email/5aa1a3b3/2606.03043) **\[v1\]**2026年6月2日星期二 02:26:18 UTC (1,384 KB)

相似文章

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

在LLM个性化中重新以人类为中心

Hugging Face Daily Papers

本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。

当没有参考答案时,LLM评委可能过于慷慨

arXiv cs.CL

本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。

Review Arcade:论LLM评审的人类对齐性与可操控性

arXiv cs.AI

本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。