LLM作为评判者在16次评估中有10次固定在一个置信值上。要求提供标签解决了这个问题。

Reddit r/AI_Agents 新闻

摘要

一个LLM评判者在评估中持续返回固定的置信分数0.72,但切换到分类标签改善了分数分布,表明模型在分类方面比数值估计更适合评估。

我一直在运行一个评估设置,其中两个LLM输出由第三个模型进行比较,遇到了一种我之前没有看到很多文献的失败模式。分享这些数据,因为修复方法出乎意料。 设置:两个智能体回答同一个提示,评判模型以随机顺序看到两个匿名化答案,返回一个赢家 + 一个置信分数0-1。标准的成对LLM作为评判者。 问题:最初的16次评估中,有10次正好返回0.72。不是围绕它聚集。相同的数字,无论一个答案明显更强还是它们几乎无法区分。这个分数没有任何信息量。 没有效果的方法:我在提示中给出了明确的锚点0.50-0.65质量几乎相同0.66-0.80有真正的但适度的优势0.81-0.92在标准上明显更好0.93-1.00一个答案未能完成任务。使用完整范围。仍然是0.72。直接告诉它返回相同的数字会使分数无意义。仍然是0.72。 有效的方法:不再要求数字。改为要求标签(平局 | 轻微 | 清晰 | 决定性),并在代码中将标签映射到分数。命名一个类别是分类。估计概率不是,而且模型在第二个方面明显较差。在接下来的44次评估中,分数分布实际上扩展到了整个范围,而不是堆积在一个值上。 第二件事,同样的教训。我告诉评判者在两个答案达到相同结论时(都解决了谜题,都选择了相同的数字)返回平局。它继续返回轻微,而它自己的书面总结说“两者都达到正确解决方案,但B更清晰地呈现它。”它认识到了收敛,但仍然奖励了呈现方式。我无法通过提示解决这个问题。最终要求一个布尔值(same_conclusion: true/false),并在代码中进行降级。同样的原则:要求模型分类,在代码中决定。 第三件事我不太确定,发布以防有人有数据。将置信度按任务类型分解为60次评估:创意0.80←最高说服力0.76逻辑0.71预测0.69策略0.68谈判0.67。评判者在最主观的类别上最果断。我的解读是它奖励具体、量化的语言而非唤起性语言,而创意提示在这两种风格之间产生最大的差异,所以差距看起来更大。让我怀疑这个的轶事:提示是“描述一个你从未去过的地方的声音,如此精确以至于变得真实。”一个答案写了关于一个清晨集市的散文,鸽子,丝绸,宣礼塔的声音。另一个写了“蝉鸣85-90分层;狮子的吼声通过地面振动在到达耳朵之前传播。”评判者选择了分贝,推理说具体的声学细节优于唤起性语言,因为提示说精确。可辩护!但这是一个数据点,创意任务n=13微不足道。如果有人测量过按任务类型的评判者置信度,我想比较一下。 总之——如果你的LLM评判者返回可疑稳定的分数,在信任之前检查实际分布。数值自我评估是我会首先关注的地方,将其替换为分类标签加上代码端映射是一个廉价的修复方法。
查看原文

相似文章

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。