我收集了所有LLM编码基准测试,并计算了它们的智能密度

Reddit r/LocalLLaMA 新闻

摘要

本文介绍了智能编码指数,一种通过聚合各种编码基准测试并对参数数量进行标准化来计算大型语言模型智能密度的方法。

在我的语境中,智能是一个聚合指数,我称之为智能编码指数,涵盖了大多数相关的智能编码基准测试:SWE-bench Pro、DeepSWE v1.1、Terminal-Bench(v4, v3, v2.1)、Code Arena Elo 和 LiveCodeBench v6。智能/参数 = 缩放因子 x (智能编码指数 / 标准化基准) ^ (超线性指数) / sqrt(参数数量 + 参数下限)。标准化基准:设置中性基线(=50)。超线性指数:非线性缩放,以避免奖励非常小的模型(否则,几乎无法编写代码的小模型会人为地主导排行榜),同时奖励真正的自主掌握能力。缩放因子 = 2.5354。参数数量:模型参数数量(以十亿计)。参数下限:模型参数的最小数量(正则化项,以避免模型<1B时分数飙升),=8B。智能编码指数:DeepSWE v1.1(20%),Code Arena Elo(20%),Terminal-Bench v4.0(15%),SWE-bench Pro(15%),Terminal-Bench v3.0(13%),Terminal-Bench v2.1(12%),和 LiveCodeBench v6(5%)。数据完整性:所有基准测试分数均来自经验证的公共和官方来源(模型创建者、同行评审的评估报告)。
查看原文

相似文章

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。