我收集了所有LLM编码基准测试,并计算了它们的智能密度
摘要
本文介绍了智能编码指数,一种通过聚合各种编码基准测试并对参数数量进行标准化来计算大型语言模型智能密度的方法。
在我的语境中,智能是一个聚合指数,我称之为智能编码指数,涵盖了大多数相关的智能编码基准测试:SWE-bench Pro、DeepSWE v1.1、Terminal-Bench(v4, v3, v2.1)、Code Arena Elo 和 LiveCodeBench v6。智能/参数 = 缩放因子 x (智能编码指数 / 标准化基准) ^ (超线性指数) / sqrt(参数数量 + 参数下限)。标准化基准:设置中性基线(=50)。超线性指数:非线性缩放,以避免奖励非常小的模型(否则,几乎无法编写代码的小模型会人为地主导排行榜),同时奖励真正的自主掌握能力。缩放因子 = 2.5354。参数数量:模型参数数量(以十亿计)。参数下限:模型参数的最小数量(正则化项,以避免模型<1B时分数飙升),=8B。智能编码指数:DeepSWE v1.1(20%),Code Arena Elo(20%),Terminal-Bench v4.0(15%),SWE-bench Pro(15%),Terminal-Bench v3.0(13%),Terminal-Bench v2.1(12%),和 LiveCodeBench v6(5%)。数据完整性:所有基准测试分数均来自经验证的公共和官方来源(模型创建者、同行评审的评估报告)。
相似文章
开源LLM基准测试每4小时运行147个编码任务,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测。好奇大家对这种方法的看法。
一个包含147个编码任务的开源LLM基准测试每4小时运行一次,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测,引发了对其方法的讨论。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
社会科学中的AI编码智能体:方法论多样、经验一致、解释脆弱
本文评估了基于LLM的编码智能体(Claude Code和Codex)在社会科学分析中的表现,发现它们在方法论多样性方面匹配或超越人类,但在通过结论层操纵产生的解释偏差方面仍然脆弱。
开源权重大语言模型与闭源大语言模型之间的差距
使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。