尽管没有经过训练,但模型的AA智能指数得分与其生成Base64编码响应的能力之间的皮尔逊相关系数竟高达0.91
摘要
研究发现,模型的AA智能指数得分与其生成Base64编码响应的能力之间存在0.91的高皮尔逊相关系数,尽管该模型并未针对此任务进行明确训练。
暂无内容
相似文章
AA 推出 Coding Agent Index —— 模型与 Harness 组合的性能对比
Artificial Analysis 推出了 Coding Agent Index,这是一套新的基准测试套件,结合了 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,旨在评估 AI 编程代理在多样化任务中的表现。
并非每项评估都需要运行
这篇研究论文表明,前沿AI模型在133个基准测试上的得分近似于秩为2,即仅两个潜在因素就解释了超过90%的方差。作者提出了BenchPress,一种在logit空间中进行矩阵补全的方法,仅需少数几个基准测试就能预测模型的完整得分表,从而显著降低评估成本。
为何AI需要“Genie系数”
本文提出一个“Genie系数”来衡量AI代理理解用户意图的程度,认为当前的基准测试未能捕捉用户所说与所想之间的差距。
AI接受还是AI采用广度?对低素养/高使用率关联的工具特定再分析
本文重新分析了一项先前声称低AI素养预测更高AI接受度的研究,发现总体负相关关系掩盖了异质性:对于文本AI工具该效应不显著,但对于非文本AI工具仍然很强,表明是一种更窄的广泛采用模式,而非普遍接受。
@xeophon: 51与GPT-5.4 xhigh得分相同,顺便说一下。该模型于3个月前发布,当时处于前沿
Z AI的GLM-5.2开放权重模型在Artificial Analysis Intelligence Index上获得51分,与GPT-5.4 xhigh持平,并且处于智能与每任务成本的帕累托前沿。