最佳AI“科学评论员”也是最有自信的——一个关于校准度与技能的基准测试
摘要
文章介绍了Refute基准测试,该测试评估LLM在评论科学论文摘要方面的能力及其校准度。结果显示,最好的批评模型在犯错时往往也最有自信。
披露:我参与了以下基准测试的工作,因此提前说明。我们一直在测试LLM是否能评论最新的科学论文摘要——捕捉其中的植入缺陷、过度主张和缺失证据——同时,分别评估它们对自己判断的校准度(使用严格适当的Brier分数评估置信度)。不断出现的模式是:最擅长*发现问题*的模型,在遗漏问题时也是最自信地犯错。批评技能和校准度似乎是不同维度,而非同一维度。原始准确性与知道何时弃权之间也存在明显差距。该基准是开放的(Apache-2.0),如果你有兴趣研究可以查看:
Leaderboard: https://huggingface.co/spaces/BGPT-OFFICIAL/refute-leaderboard
Dataset: https://huggingface.co/datasets/BGPT-OFFICIAL/refute
好奇其他人如何看待测量校准度与原始能力之间的权衡——适当的评分规则就足够了吗,还是也需要明确的弃权指标?
相似文章
AI研究工具仍过于热衷将公开信号转化为确定性
作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。
问题不在于AI犯错,而在于它犯错时如此自信
讨论了AI模型以高置信度产生错误答案的问题,强调了AI输出中的过度自信问题。
AI 自信犯错的程度远超人们想象,不服来辩
一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。
SoundnessBench:你的AI科学家真能区分研究创意的好坏吗?
SoundnessBench是一个包含1,099个机器学习研究提案的基准测试,用于评估大语言模型评判方法论有效性的能力,结果发现当前模型普遍存在乐观偏差。
大型语言模型中的置信度校准
本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。