我们的评估分数上升了,同时点踩率也上升了,就在同一周
摘要
一个团队观察到,在同一周内,自动评估分数和用户点踩率都上升了,这表明客观指标与用户满意度之间存在不匹配。
暂无内容
相似文章
[ICML 2026] 分数先涨后降!![D]
一位研究者分享了其ICML 2026论文审稿经历:审稿人在 rebuttal 阶段提高了分数,随后又降了回去,作者对是否会被拒稿表示担忧。
量化评分标准修改对人类与自动评分者一致性影响的统计分析
本研究分析了评分标准(rubrics)的修改(例如从整体性标准转变为分析性标准)如何影响人类评分者与 AI 自动评分者之间的一致性。研究结果表明,提供示例和减少偏见有助于提高一致性,而更高的复杂性往往会降低一致性。
在Hugging Face模型页面上展示Every Eval Ever的所有结果
Every Eval Ever (EEE) 与 Hugging Face Community Evals 现已互操作,允许将 AI 评估结果标准化地交叉发布到模型页面,提升信任度和可比性。
@OpenAI: 我们来聊聊评估。我们一直在寻找更好的方法来衡量和预测模型的进展,尤其是在基准测试...
OpenAI讨论了评估(evals)的重要性,用于衡量和预测模型进展,尤其是在基准测试变得饱和或被操纵的情况下,并邀请了Tejal Patwardhan和Andrew Mayne分享见解。
花了一整晚试图攻破自家的AI病毒式传播评分,结果它一动不动——原因在此。
作者讲述了一整晚试图操纵自家AI病毒式传播评分系统的经历,却发现分数拒绝改变,展现了系统的稳健性。