我让55个LLM互相盲评(22k条评价,全部公开)。每个有足够数据的模型家族都偏向自家兄弟。Qwen的评委给Qwen加分约0.9分。Mistral给自己的扣分约1.0分。

Reddit r/LocalLLaMA 论文

摘要

一个包含55个LLM互相盲评的公开评估设置揭示了8个模型家族中统计显著的同类家族评分偏差,其中Mistral对自己模型的扣分最为严重。该研究指出了聚合排行榜的问题,并提出了改进方法,如使用响应内混合效应模型。

我一直在运行一个公开评估设置:让N个模型回答同一个提示,然后在一个N×N矩阵中互相盲评,排除自评。没有单个特权评委。截至目前:286个评估,198个手写问题,涵盖55个模型(来自11个开发者家族)的22,254条有效评判。代码、数据集和所有提示都是MIT许可。我未曾预料到的发现:在8个有足够数据的家族中,同类家族评分偏差全部统计显著(p < 0.05,其中7个通过Bonferroni校正)。在0-10分制上:Qwen评委给其他Qwen模型评分+0.91,xAI +0.75,Anthropic +0.62,MiniMax +0.31,OpenAI +0.23,Google -0.59,Meta -0.68,Mistral -1.02。正向内群体偏差是预期的故事,负向偏差才是有趣的部分。Mistral的评委系统地给其他Mistral模型打低整整1分,是整个集合中绝对值最大的偏差。我之前没看到过相关报告,也没有一个干净的解释。可能是训练数据、RLHF偏好数据或风格自我惩罚。另外还有两点发现:聚合排行榜隐藏了很多——九个类别池中有六个不同的模型占据榜首,所以“最佳模型”是个错误的问题。而代码领域评委分歧最大,分歧程度几乎是元对齐领域的两倍,这使得单一评委的代码评估尤其不可靠。仓库和数据:github.com/themultivac/multivac-evaluation 论文:themultivac.com/papers/blind-peer-matrix.pdf 我认为下一步需要做的,也是我希望得到反馈的地方:锚定到已有的真实数据。任何同行评议设置的合理批评都是LLM在评LLM。对于代码和数学,这是可修复的:用测试套件或验证器来评分,只在无法通过执行判断时使用评委。在最近的一次代码运行中,评委实际上与并发测试的执行结果相矛盾,更倾向于测试失败的回答,所以这不是假设性问题。控制响应质量的偏差数字。目前同类家族偏差是原始分数差距,这混淆了真实偏差和某些家族可能确实产出更好答案的可能性。更干净的方法是固定响应,通过响应内混合效应模型,比较同一家族评委和其他家族评委对完全相同的输出的评分。这就能将评委效应与答案质量分离。这是我最想巩固的结果。更好的聚合方式而非简单平均。均值将宽松的评委和严格的评委同等对待。一个能联合估计评委宽松度和题目难度的Bradley-Terry或项目反应模型可以提供更诚实的排名,我会将其与当前数字并行运行,看看变化有多大。测试同类家族偏差的机制。如果是风格自我识别,那么通过改写回应来剥离表面风格应该会缩小偏差。这是一个干净的反事实检验,我还没看到有人做过。与人类验证并解决问题单一文化。在子集上进行人类相关性研究显然是黄金标准检查,而我自己写了所有198个问题,因此多作者或预留的真实世界提示可以消除我在问题设计上的印记。诚实的弱点是:它仍然是LLM在评LLM,而且每个问题都是我写的。我宁愿现在就听到方法论批评,而不是等到提交之后。在相信这些数字之前,你希望看到什么?
查看原文

相似文章

我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。

Reddit r/artificial

一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。