evaluation-reliability

标签

Cards List
#evaluation-reliability

在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性

arXiv cs.AI · 2026-07-22 缓存

本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。

0 人收藏 0 人点赞
#evaluation-reliability

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL · 2026-07-10 缓存

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

0 人收藏 0 人点赞
#evaluation-reliability

抛硬币裁判?LLM-as-a-Judge评估的可靠性与偏见

arXiv cs.CL · 2026-06-15 缓存

本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈