@alexwan55: 40%的基准测试工作集中在数学/编码领域,但相关职业仅占美国工作岗位的3.5%。我们推出了Econ…
摘要
介绍EconEvals,一个开源评估套件,用于衡量AI能力并预测全美劳动力经济中的就业冲击,解决了基准测试重点(数学/编码)与实际岗位分布之间的错位。
查看缓存全文
缓存时间: 2026/06/26 10:09
40%的基准测试工作聚焦于数学和编程,但相关职业仅占美国就业岗位的3.5%。
我们推出开源评估套件EconEvals,用于衡量能力并预测美国劳动经济中职业受冲击的情况。https://t.co/wxQykhUqCI
相似文章
并非每项评估都需要运行
这篇研究论文表明,前沿AI模型在133个基准测试上的得分近似于秩为2,即仅两个潜在因素就解释了超过90%的方差。作者提出了BenchPress,一种在logit空间中进行矩阵补全的方法,仅需少数几个基准测试就能预测模型的完整得分表,从而显著降低评估成本。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
衡量我们的模型在实际任务中的性能
OpenAI 推出 GDPval,这是一个新的评估框架,用于衡量 AI 模型在涵盖美国 GDP 贡献最高的 9 个行业中 44 个职业的经济价值任务上的表现。该基准包括 1,320 个基于实际专业工作产物的专业化任务,代表了从学术基准向更现实的职业评估的进步。
@OpenAI: 我们来聊聊评估。我们一直在寻找更好的方法来衡量和预测模型的进展,尤其是在基准测试...
OpenAI讨论了评估(evals)的重要性,用于衡量和预测模型进展,尤其是在基准测试变得饱和或被操纵的情况下,并邀请了Tejal Patwardhan和Andrew Mayne分享见解。
不要声称面向基准测试的优化能提升通用编码能力——需要多样化的评估
该论文批评了依赖如SWE-bench等有限的编码基准测试来衡量AI模型的通用编码能力的做法,表明针对这些基准测试的优化无法泛化,并倡导多样化的评估方法。