棉花糖 AI 基准测试
摘要
一项基准测试通过提示 AI 模型在图像中数棉花糖来评估它们,结果从 472 到 539 个不等。
我介绍棉花糖基准测试。我将一堆棉花糖倒在一个烤盘上单层铺开,并拍了一张照片。然后我向几个 AI 工具提供了以下提示:“给我准确计算这张图像中可观察到的单个棉花糖数量。棉花糖是单层铺开且全部可见的。不要猜测或估计;你必须在计数前直接观察每个棉花糖,以防止假设和幻觉。” 响应:Gemini 3.7 Flash Extended: 539 Claude Opus 5.0 extra: 501 GPT-5.6-Sol xhigh: 500 Grok 4.5 expert: 472 Kimi k3 high: 477
相似文章
新基准测试发布
一个新基准测试已发布,可能用于评估AI或软件性能。
最终基准测试
本文提出了一项权威基准测试,旨在评估和比较AI模型或系统,并为未来的评估确立标准。
唯一的基准是Twitter上的AI资深用户对你模型的感受
一条由@vasuman发布的推文表明,Twitter上AI资深用户的情绪是评估AI模型最关键的基准。
我对18个AI模型做了基准测试:哪个写出来的东西最不像“AI slop”
一位开发者构建了一个名为The Slop Index的开源基准,用于衡量18个AI模型产出“AI slop”的程度。它采用人类基线,并从简洁性、模板化、节奏、破绽和人类偏好五个维度进行评估。
@ApexAIHighlight:大多数AI基准测试模型是否能给出正确答案。@Accio_official 正在测试更难的事情:能否……
CommerceAgentBench是一个新的基准测试,包含107个真实电子商务任务,旨在检验AI代理能否实际完成工作,超越传统的基于答案的AI基准测试。