标签
一条幽默的推文,评论了人工智能模型智能的预期进展,将其从博士水平与决定不攻读博士学位的人的水平进行对比。
OpenAI讨论了评估(evals)的重要性,用于衡量和预测模型进展,尤其是在基准测试变得饱和或被操纵的情况下,并邀请了Tejal Patwardhan和Andrew Mayne分享见解。