我们基准测试的是无人实际运行的模型

Reddit r/LocalLLaMA 新闻

摘要

文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。

qwen3.8-27b 在基准测试表中看起来确实令人印象深刻 - 在某些指标上击败了比它大得多的模型。但这些数字来自bf16权重,而这里没人以bf16运行27b模型。我们运行的是4-bit版本,大约17GB,因为这正好能装在4090或24GB的Mac上。因此,被测量的模型和被下载三百万次的模型并不是同一个版本。我在任何地方都找不到这样的东西:一个模型,一个测试框架,横跨bf16 / Q8 / Q6_K / Q5_K_M / Q4_K_M / IQ4_XS,并带有误差线。困惑度图表确实存在,但困惑度可能几乎保持不变,而某些具体方面——如长上下文回忆、多步数学、严格工具调用JSON——却悄然失败。对于一个视觉模型和256k窗口,发生这种情况的可能性比平时大得多。我真正关心的问题是:在相同的显存下,27b的Q4版本是否比更高精度的小模型更好?这是每个人都需要做的决定,但我从未看到它被测量过。是的,red hat和neural magic发布了他们量化版本的评估,llama.cpp有kld工具。但没人系统性地进行,没有在发布时使用模型卡上指定的测试框架。这是否存在,而我错过了?如果不存在——有闲置算力的人有兴趣吗?首先就测试框架和提示集达成一致是唯一的难点;之后只是大量时间投入。
查看原文

相似文章

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。

大型AI企业实验室提供的模型,按FTC定义构成欺诈

Reddit r/ArtificialInteligence

文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。