我们重新规范地运行了基准测试。15个模型、3,595条回复,以及我们上次的两个结果未能经受住验证
摘要
本文详细描述了对15个模型进行的AI基准测试重新运行,纠正了先前的错误,并分析了多语言定价任务中的准确性、成本和写作质量等因素。
我们重新运行了两周前的8模型测试。15个模型,8个案例,每个30次生成,斯洛文尼亚语和英语,3,595条评分回复。设计主要来自u/ReleaseFlashy9582和u/Key_Menu4194,他们要求30次生成和每千次错误引用次数,而不是通过/失败表格。第一篇文章中的两个结果未能复现,而且都是我们自己的。Claude Haiku引用了9.00,而正确答案是9.60。这个失败是整个第一篇文章的核心。在240次尝试中,它从未复现过。GPT-4o mini偏差4倍的情况也再未发生。两者都是单次样本,我们却像它们很重要一样发布了它们。现在替代的结果更糟。商店按数量阶梯定价照片,10张起每张0.32欧元,100张起每张0.30欧元,150张起每张0.28欧元。在99张时,正确总价是31.68欧元。GPT-4o mini说29.70欧元,即99 x 0.30,这是高一级的阶梯。它在30次中都这样做了。斯洛文尼亚语30次全错,英语30次全错。在98张时正常,在100张时也正常。所以这不是随机的。它误读了阶梯上的那个点,并且每次都这样。这是6%的偏差,而6%是让我困扰的数字。我们的防御是人工在发送前审核草稿。没有人能发现29.70欧元 vs 31.68欧元的错误,它看起来完全像一个价格。所以我们单独计算了两类错误:审阅者能发现的明显错误,以及在25%以内被批准并送达客户的隐蔽错误。GPT-4o mini每千条回复产生250个隐蔽错误,零个明显错误。十五个模型中有十个在每个回复上都正确,每个240次,两种语言,包括边界案例。第十一个也从未引用错误价格,它的一次失误是一个根本没有价格的回复。所以准确性不再能区分模型。我们预期这将是主要的区分点,但事实并非如此。测试中最便宜的模型(Ling 3.0 Flash,0.000024美元/回复)在所有完成的236个中都完美,而Claude Haiku也完美,但每回复成本高出89倍。既然算术不能区分它们,我们盲评了写作质量,120条回复,剥离模型身份,打乱顺序,评分后再匹配回来。在五个维度中,只有一个能区分:回复是否展示计算过程,以便客户可以核对数字。这个维度的评分范围从2.00到4.63,而下一个最宽的范围是1.50。两个模型处于底线。一个是Grok 4.3,另一个是GPT-5.6 Luna,这是我们第一轮后设为生产默认的模型。两者都是100%正确,但都只给你一个总价,没有可核对的内容。我们基于成本和正确性选择了它。我们从未读过它实际写的内容。有两点削弱了这个发现,我宁愿自己说出来而不是被别人指出。展示计算过程与回复长度相关系数为0.85,跨模型,而我们自己的系统提示要求简短回复,所以这衡量的部分只是冗长。而且盲评来自Claude,Claude Haiku是测试模型之一。身份剥离和顺序打乱,但仍然是Claude在评Claude。我们还在本文草稿完成后发现了一个我们评分器的bug。每个问题都命名了打印格式10x15,而15作为候选数字从我们的价格提取中幸存下来。23条根本没有引用价格的回复被归类为错误价格。没有模型的正确性移动,正确总价的精确匹配是明确的,但隐蔽和明显错误的分割移动了,而这个分割是一半的重点。我们从保存的转录中重新评分。第一轮没有保存转录,所以其最奇怪的结果永远无法确定。有一点值得说,因为它回答了启动这个问题的疑问。30次生成带来的收益低于预期。我们的120个模型-案例单元中,有101个在30次中返回了相同的判断,单元内平均一致性为97%。GPT-4o mini在99张时30/30全错,而在其他地方0/210是最清晰的案例。所以独立单元实际上是案例,而不是回复,而基于240条回复的置信区间会高估它。在8个案例上,一个没有观察到错误的模型有95%的上界接近每千次375,而不是12。我们也从未设置温度,所以每个模型都以提供商的默认设置运行,这可能就是它们如此确定性的原因。它没有告诉你的:一个价格阶梯上的8个案例,所以能读这个阶梯的模型可能在另一个阶梯上失败。这里有人有默认展示计算过程的生产模型,而不需要在提示中指定吗?这是我们正在尝试修复的问题,而提示它感觉像是错误的答案。
相似文章
我们基准测试的是无人实际运行的模型
文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。
@svpino: 我不信任基准测试。我们都看过这样的戏码:新模型在基准测试中击败所有人。人们热议它。然后…
这条推文批判了传统的AI基准测试,并介绍了TRACES,这是一个新的基准测试,专注于评估模型如何得出答案的过程,包括工具使用、错误纠正和证据追踪。
新评测标准的时机
本文讨论了在AI领域引入新评测标准的必要性,以更好地评估模型性能并解决现有标准的局限性。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
我不再相信模型基准测试,开始运行自己的评估集,这是变化所在[D]
作者描述了由于供应商创建的指标、自报参数和缺乏独立验证而对公开AI模型基准测试失去信心,并主张从真实生产流量中构建自定义评估集以进行更相关的模型比较。