@reach_vb: 嘿 @simonw - 既然 pelican on a bike svg 已经饱和(?),你现在评估模型或 harness 的首选方法是什么…
摘要
一条来自 @reach_vb 的推文,向 @simonw 询问评估 AI 模型或 harness 的方法,提到了已饱和的 'pelican on a bike svg' 基准。
嘿 @simonw - 既然 pelican on a bike svg 已经饱和(?),你最近评估模型或 harness 的首选方法是什么?
相似文章
@karpathy: More on the pelican on the bicycle test from @simonw: https://simonwillison.net/2025/Jun/6/six-months-in-llms/… I uploa…
Simon Willison's keynote at AI Engineer World's Fair reviews the last six months in LLMs, highlighting over 30 significant model releases and his 'pelican on a bicycle' SVG benchmark as a practical evaluation tool.
Are AI Labs Pelicanmaxxing?
一项分析调查了AI实验室是否在针对流行的‘骑自行车的鹈鹕’SVG基准测试优化其模型,该测试在48个提示中测试了七个前沿模型,使用不同的动物和车辆,未发现过拟合的强有力证据。
scosman/pelicans_riding_bicycles
Simon Willison 的链接帖介绍了一个名为“pelicans_riding_bicycles”的数据集或项目,可能用于 LLM 训练或生成式 AI 实验。
@omarsar0:重要讨论。衡量模型与测试工具的对比完全失效。我更倾向于使用最小化的测试工具如Pi和Hermes Agent来测试模型质量…
作者批评了因偏见和缺乏标准化而导致的AI模型测试工具衡量系统的失效,同时推测像Claude这样的模型可能很快就能动态生成测试工具。
AI实验室是否在搞'pelicanmaxxing'?
Dylan Castillo进行了一项严谨的调查,以确定AI实验室是否在秘密训练模型绘制骑自行车的鹈鹕。通过测试多种动物-车辆组合的多个模型,他没有发现'pelicanmaxxing'的证据。