我能够复现AI基准测试,但仍然无法验证业务声明。

Reddit r/artificial 新闻

摘要

一位研究人员复现了AI基准测试,但发现由于指标聚合和模型集成问题,验证业务声明具有挑战性,强调了对AI性能声明进行仔细审查的必要性。

我原本以为那些炫目的AI声明是最难验证的部分,但情况几乎相反。我筛选了100个XPRIZE AI项目,仔细查看了14个,并使用公开代码、数据、实时产品和官方文档独立测试了5个。一个产品报告了行为科学效果的91.2%复制率。我重新运行了公开响应和评分代码,得到了91.2%。但这个数字在很大程度上取决于聚合规则: - 任意五个模型之一:91.2% - 最佳单个模型:79.4% - 合并响应:73.5% - 多数模型:67.6% 他们的代码库对第一条规则作为乐观上限是透明的。所以有趣的部分不是数字是否是假的。它不是。问题是这个数字到底意味着什么。另一个业务声称AI暂停广告支出,每晚重写策略,并撰写产品文案。公开的代码显示: - 广告暂停:确定性阈值,无模型调用 - 策略:Claude - 产品文案:Gemini 所以“AI运营业务”在技术上隐藏了三个非常不同的机制。我在其他地方发现了同样的模式。一个法律翻译产品正确引用了WMT25基准:87份文档,332个片段。但官方数据集包含文学、新闻、社交媒体和语音文本。法律领域片段:零。这些发现都没有使原始声明简单地“正确”或“错误”。验证不断变成另一个问题:到底测量了什么?证据支持什么范围?模型实际在系统中扮演什么角色?奇怪的是,技术声明通常是可以复现的。我无法独立验证的声明是诸如收入、客户数量和使用量之类的东西,因为这些记录不是公开的。我在这里写下了这五个案例。我仍在思考的是:当AI基准测试精确复现时,在称底层声明被独立验证之前,还需要其他什么为真?
查看原文

相似文章

大型AI企业实验室提供的模型,按FTC定义构成欺诈

Reddit r/ArtificialInteligence

文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。