标签
作者在压缩文件上测试AI图像检测器,并讨论如何在现实场景中解读检测分数,强调分数与视觉检查之间的冲突。
对GPT-4o-mini和GPT-4o在事件分类系统上的评估显示GPT-4o表现更好,但两个模型的置信度分数在实际决策中都不可靠。
作者认为,要求LLM生成自我评估的置信度分数在科学上是无效且具有误导性的,它只是一种心理安全把戏,而不是衡量正确性的可靠方法。
Vik Paruchuri宣布了研究驱动的防护措施,在其基准测试中将OCR幻觉降至接近零,并为任何残留错误提供单词级边界框和置信度分数。