创建了一个LLM测验程序,用于检查AI性能是否随时间变化
摘要
一位开发者创建了LLM Canary,这是一个开源测验程序,向多个LLM发送随机任务以跟踪其性能随时间的变化。经过一周每小时对七个模型的测试,结果显示所有模型在一天中都有波动,没有一致的模式,也未发现明显的性能下降证据。
我注意到Reddit上越来越多的帖子和评论声称LLM模型要么随时间变得更笨,要么在一天中性能变化不定。我尝试寻找长期的随时间变化的性能图表或跟踪此问题的仓库,但在GitHub和Google上搜索了5分钟后一无所获。所以我最终构建了LLM Canary。
**它的功能和工作原理**:程序向一组LLM发送伪随机问卷,对每个答案进行程序化评分,并记录结果。每次运行包含25个问题:算术任务、数数字母、倒序单词、预测JavaScript输出、一个具有5、10和15条同时规则的链式密码游戏,等等。我用crontab每小时运行一次,持续一周,覆盖7个模型:Claude Haiku 4.5、Claude Sonnet 4.6、GPT-4.1、GPT-4.1 Mini、GPT-4o Mini、GPT-4.1 Nano、Gemini 2.5 Flash Lite。最一致的数据来自Claude,因为我只在部分时间引入了其他提供商——而Gemini昂贵的旗舰模型消耗预算太快,无法收集足够的数据。如果想了解更多,请查看仓库中的readme。
**注意**:一周时间不足以证明或反驳性能下降的说法——我需要运行更长时间,并逐周或逐月审查性能。我目前拥有的是一个能够提问并建立ELO评分的项目。
# 发现
首先——*所有*模型在一天中都有波动,且没有一致的模式。有些模型波动较大,比如Gemini 2.5 Flash Lite,而其他模型如GPT-4.1 Nano在GMT+0时间早上6点到下午1点之间表现出稳定、可预测的性能区间,偏差较小。如果API负载在特定时间导致性能下降,你会预期同一时间多个提供商的表现都不好——但我们看到的情况并非如此。
根据目前收集的数据,没有明确的“铁证”表明模型变笨了。模型在难题上表现挣扎,有些模型更甚。所以这是一个直接发现——一次成功回答问题的模型,下一小时不一定能通过。关键在于一致性和问题难度。
接下来:按问题直接比较模型并不公平,因为有些模型天生擅长数学,而另一些则专为语言和写作设计——但我们还是来比一比吧。以`*letter_count*`为例。提示类似:单词'ecophysiologies'中字母'c'出现了多少次?仅回复数字。几乎所有模型都以40–60%的准确率通过。然而,GPT-4.1 Nano和Gemini 2.5 Flash Lite尴尬地分别只得到16.8%和17.76%。
另一个有趣的发现:更便宜的Anthropic模型Claude Haiku 4.5在统计段落中元音字母数量方面优于Claude Sonnet 4.6(71.58% vs 64.74%)。在其他几乎所有问题上,Sonnet 4.6都领先。
`*count_f*`是一个提示,程序从圣经中随机选取段落,要求LLM统计字母'f'的出现次数。几乎所有模型都失败了,通过率约7.5%——它们倾向于跳过像“of”和“for”这样的停用词——但列表中能力最强的Claude Sonnet 4.6达到了45.79%。
`*word_count*`是一个类似的测试:提示从圣经中随机取一段,要求LLM统计单词数量。同样,大多数模型跳过停用词,平均通过率约5.5%,但GPT-4o Mini达到了16.54%。
GPT-4.1 Nano是其中最弱的。其总平均分仅为45%,ELO为965.98——并且在25道问题中,有9道得分最低——而Claude Sonnet 4.6以75%的平均分和1293.29的ELO领先。327分的ELO差距在纸面上可能听起来不惊人,但每个问题的分解使得性能差异难以忽视。
最后,回到日内波动(每小时最小-最大差值),除了Claude(Haiku和Sonnet)之外,其他模型大约有150点的波动。它们的波动差值总和约为4.4k。除以24得到约183.3个ELO点。这大概就是让人们察觉的原因——让人感觉“今天早上的Claude比昨天更笨了”。
相似文章
LLM团队能玩‘What? Where? When?’吗?
本文研究了在问答游戏‘What? Where? When?’(ChGK)中,基于团队协作的交互是否能提升LLM的表现。通过在2025年发布的572道问题的数据集上使用六个最新的开源LLM,他们展示了团队策略(投票、沉默队长、健谈队长)比单个模型高出最多20个百分点,最佳团队达到了44.23%的准确率,接近人类水平。
新研究测试多款LLM与数千真实用户,发现AI无法模拟人类偏好
一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
开源LLM基准测试每4小时运行147个编码任务,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测。好奇大家对这种方法的看法。
一个包含147个编码任务的开源LLM基准测试每4小时运行一次,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测,引发了对其方法的讨论。
LivingArena:LLM是否知道其他LLM不知道的?同伴探查作为可扩展评估
本文介绍LivingArena,这是一个自动化的评估框架,其中LLM通过生成问题来探查彼此弱点,实现抗污染和可扩展的评估,并能随模型改进而适应。