我分析了31,352个每小时LLM基准评分:日内波动为2.8分,而日间波动为8.4分 [P]
摘要
对31,352份每小时LLM基准评分的分析显示,日间波动约为日内波动的三倍,强调了持续监测性能漂移的重要性,从而促成了AIStupidLevel系统的创建。
https://preview.redd.it/42s57e5oqamh1.png?width=1903&format=png&auto=webp&s=69958a72e22276534b3605d11f3e1721f76e59c9 披露:我开发了AIStupidLevel,这是一个用于收集和分析这些数据的开源系统。前端和后端均采用MIT许可证。大多数LLM评估在单一时间点测量性能。我想研究一个不同的问题:生产API背后的模型随时间如何稳定,以及如何将持续的性能变化与普通的随机变异区分开来?我构建了一个持续评估管道,重复测试模型在编码、深度推理、工具调用和高频金丝雀任务上的表现。数据集和评估过程 对于这项分析,我检查了:31,352份每小时基准评分 49个模型标识符 多个提供商和模型系列 使用一致任务和评分的重复测量 一个归一化的0-100复合评分 编码响应被执行,而不仅仅是通过基于模型的评估来判断。工具调用测试要求模型在隔离的Docker环境中选择工具、构造有效的参数并完成工作流程。任务被执行五次,结果被聚合以减少异常强或弱生成的影响。提示、评分逻辑和API参数在提供商支持的情况下保持一致。主要结果 观察到的评分波动为:同一天内:2.8分 不同天之间:8.4分 因此,日间波动约为日内波动的3倍。这表明,孤立的小时级波动主要由正常的模型随机性主导,而跨日评估窗口的持续变化为检测性能漂移提供了更强烈的信号。检测管道将重复测量聚合为每日中位数,并应用序列变点检测。潜在事件必须持续超出预期的历史方差,并通过统计和最小效果阈值,才能被分类为降级或恢复。持续模型监测 这项分析成为AIStupidLevel的基础,这是一个持续的LLM基准测试和漂移检测系统。完整数据集现已达到:169,858次基准运行 104,458次测量评分 8800万+处理的令牌 81个历史模型标识符 22个当前监测的模型 6个活跃提供商 附带的截图显示了实时监测界面。模型被分类为稳定、波动、降级或恢复,分别测量编码、推理、工具使用、可靠性、延迟和价格。在截图时,系统检测到Gemini 3.1 Flash Lite有32%的持续性能下降,并将其分类为严重事件。同一持续更新的数据集还驱动一个兼容OpenAI的路由器,根据模型的当前特定任务性能、稳定性、工具调用可靠性、延迟和成本选择模型。这为生产LLM系统增加了一个缺失的可观测性维度。现有监测通常捕获可用性、错误、延迟和令牌成本。持续评估还测量模型是否仍能执行其被选择的工作。项目资源:实时数据集和仪表板:https://aistupidlevel.info 评估方法:https://aistupidlevel.info/methodology MIT许可的前端:https://github.com/StudioPlatforms/aistupidmeter-web MIT许可的后端/API:https://github.com/StudioPlatforms/aistupidmeter-api 我有兴趣将这种方法与其他用于生产LLM监测的时间评估或变点检测系统进行比较。
相似文章
创建了一个LLM测验程序,用于检查AI性能是否随时间变化
一位开发者创建了LLM Canary,这是一个开源测验程序,向多个LLM发送随机任务以跟踪其性能随时间的变化。经过一周每小时对七个模型的测试,结果显示所有模型在一天中都有波动,没有一致的模式,也未发现明显的性能下降证据。
开源LLM基准测试每4小时运行147个编码任务,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测。好奇大家对这种方法的看法。
一个包含147个编码任务的开源LLM基准测试每4小时运行一次,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测,引发了对其方法的讨论。
@ms_aifrontiers: 大多数LLM基准测试得分在运行之前即可预测。MS AI Frontiers团队新作:BenchPress。……
MS AI Frontiers团队推出了BenchPress,该方法利用矩阵补全技术,仅通过五个探针即可预测LLM基准测试得分,表明得分矩阵实际上为秩2。
量化LLM基准中的排名不确定性
本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。
The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance
This paper introduces BenchDrift, a method for quantifying how LLM benchmark performance changes when problems are rephrased without changing meaning or answer. It shows that rephrasing causes bidirectional correctness flips across models and benchmarks, with stronger models becoming more sensitive to phrasing.