confidence-scores

标签

Cards List
#confidence-scores

在压缩文件上测试图像检测器:我们应如何权衡检测分数?

Reddit r/ArtificialInteligence · 2026-08-22

作者在压缩文件上测试AI图像检测器,并讨论如何在现实场景中解读检测分数,强调分数与视觉检查之间的冲突。

0 人收藏 0 人点赞
#confidence-scores

评估了两个模型在同一个分类任务上的表现,其中一个将卡拉OK之夜标记为音乐活动

Reddit r/AI_Agents · 2026-08-17

对GPT-4o-mini和GPT-4o在事件分类系统上的评估显示GPT-4o表现更好,但两个模型的置信度分数在实际决策中都不可靠。

0 人收藏 0 人点赞
#confidence-scores

不要向LLM询问置信度分数

Hacker News Top · 2026-07-28 缓存

作者认为,要求LLM生成自我评估的置信度分数在科学上是无效且具有误导性的,它只是一种心理安全把戏,而不是衡量正确性的可靠方法。

0 人收藏 0 人点赞
#confidence-scores

@VikParuchuri: OCR幻觉会污染下游工作流。我们构建了研究驱动的防护措施,将幻觉减少到接近…

X AI KOLs Following · 2026-07-02 缓存

Vik Paruchuri宣布了研究驱动的防护措施,在其基准测试中将OCR幻觉降至接近零,并为任何残留错误提供单词级边界框和置信度分数。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈