单一能力还是多重能力?测试前沿人工智能评估的经济有效性
摘要
这项研究检验了人工智能排行榜中的经济基准是在衡量独立能力,还是仅仅反映一个总体趋势,结果表明它们提供了额外的信息,但主要受时间因素驱动。
arXiv:2608.29420v1 公告类型:新
摘要:前沿模型排行榜现在基于经济基准对系统进行排名,这些基准测试模型在从软件工程到银行工作流程的专业任务中的表现,这些排名指导着组织购买、监管机构审查以及工作方式变化的预期。这类基准是衡量与一般测试不同的能力,还是重新表达了随着模型改进每个基准都上升的单一轴线,是一个尚未研究的构念效度问题。我们使用包含421个模型配置的哈希固定排行榜快照在十二个基准上进行了测试,其中四个是经济基准,将基准视为项目,模型视为受访者,在一个潜变量模型中测试四个假设,并在分析前固定其阈值。单个因子解释了74.5%的共同方差,并追踪模型发布日期(R^2 = 0.505),因此能力的主要轴线在很大程度上是时间趋势;先前的研究控制规模后,一旦移除日期,计算增加很少。移除日期趋势使该份额降低14.9个百分点,每个基础模型一行时降低24.1个百分点。在预先固定的维度规则下,经济基准不构成一个独立因子,但每个折叠内重新估计因子的留一基准测试表明,多因子表示比单一通用指数更好地预测保留的经济分数(汇总Delta-MSE 0.037,95%自举区间[0.019, 0.055])。因此,经济基准为主要由日期驱动的通用因子增加了增量预测信息,证据不支持将它们视为一个独立的潜在能力。排行榜仍然是整体进展的可靠指南,但相隔数月发布的模型之间的差距主要是日历上的,因此同时期模型之间的微小差距应在被解读为能力差异之前进行日期调整。
查看缓存全文
缓存时间: 2026/09/01 13:15
# 单一能力还是多元能力?检验前沿AI评估的经济有效性 来源:https://arxiv.org/html/2608.29420 作者:Louis Yiven Zhu††thanks:ORCID 0009\-0001\-5579\-0340\ ###### 摘要 前沿模型排行榜现正根据经济基准对系统进行排名——这些测试评估模型执行从软件工程到银行工作流程等专业任务的能力——而这些排名直接影响着机构的采购决策、监管机构的审查重点,以及人们对工作变革的预期。此类衡量标准是独立于通用考试能力,还是仅仅沿袭了模型提升时所有基准共同增长的单一维度,这一构念效度问题尚未得到系统研究。我们通过一个固定哈希的排行榜快照(涵盖十二项基准、421个模型配置,其中四项为经济基准)进行验证,将基准视为项目、模型视为受试者,构建包含四个预设假设及其阈值的潜变量模型。单一因子解释了74.5%的共同方差,且与模型发布日期高度相关(R²=0.505),这表明能力主导轴实质上是一个时间趋势;先前研究中对规模的控制变量在剥离日期因素后解释力甚微。消除日期趋势后,该因子占比下降14.9个百分点;当按基础模型去重后重复分析时,降幅达24.1个百分点。根据预设维度规则,经济基准并未形成独立因子;但通过"留一基准"测试(每次折叠内重新估计因子)发现,多因子表示法对保留的经济分数预测效果优于单一通用能力指数(汇总ΔMSE=0.037,95%自助法置信区间[0.019, 0.055])。因此,经济基准在很大程度上由日期驱动的通用因子基础上提供了增量预测信息,现有证据不支持将其视为独立的潜在能力。排行榜仍是衡量整体进展的有效指引,但相隔数月发布的模型间差距多源于时间因素,故同期模型间的微小差异应在被解读为能力差异前进行日期校正;对于基准构建者,我们提出了一套双检验方案以证明新基准套件具有额外测量维度。 ## 1 引言 公开排行榜已成为比较和采购前沿语言模型的主流工具,并日益影响政策制定,因此其评估依据的近期转变带来了直接关系经济利益的测量问题。除GPQA(研究生水平谷歌防御问答)(Rein等人,2024)和HLE(人类最后考试)(Phan等人,2025)等学术知识测试外,排行榜现已纳入*经济*基准,如GDPval(Patwardhan等人,2026)、τ-Bench系列(Yao等人,2025;Barres等人,2026)以及终端或智能体编码套件(Merrill等人,2026),这些基准均旨在模拟有偿专业工作和多步骤工具使用,其中τ³-Banking更是针对银行业客户支持这一政策合规场景——当前评估套件对此类场景的覆盖尚显不足。这些基准是否值得单列取决于其测量内涵。若它们捕捉的能力确实区别于通用考试能力,则携带了单一"智能"分数无法涵盖的信息;若仅是模型进步主导维度的再表达,则单独列示便夸大了排行榜的认知边界。这是关于构念效度的问题——即测量工具在多大程度上反映了其声称的构念(Cronbach与Meehl,1955;Messick,1998)。尽管学界呼吁机器学习基准应遵循心理测量标准(Raji等人,2021;Jacobs与Wallach,2021;Bowman与Dahl,2021),但近期审计发现AI评估系统的构念效度普遍存在系统性检验缺失(Bean等人,2025;Kearns,2026)。我们将前沿模型在十二项基准上的评分快照构建为心理测量问题:基准为项目,模型为受试者,分数为用于推断潜结构的响应数据,并在预设设计框架下(图1)进行解答。四个研究问题组织分析过程,各对应一个预设假设(第4.3节);前三个问题关注结构(任务1,无监督),第四个问题关注预测(任务2,有监督)。 1. RQ1(主导性)该指标组测量了多少潜在能力?主导能力占比多高? 2. RQ2(时间混杂)主导轴是否受发布日期影响?经日期校正后还剩余多少? 3. RQ3(结构独特性)经日期校正后,经济基准是否加载于独立因子? 4. RQ4(预测效度)多因子表示法对保留的经济分数预测效果是否优于单一通用指数? 图1:研究设计。(a)基准视为项目(列,按能力模块着色,经济基准为红色),模型配置视为受试者(行,按发布日期排序);预设覆盖规则将548个配置缩减为421×12矩阵。(b)两种候选结构:单一日期驱动的通用因子g,或通用因子g与独立经济因子e共存。(c)两项预设检验:日期校正后重新拟合(H1–H3)与留一基准预测(H4);网格图为示意图。 #### 贡献 本文贡献如下:首次对前沿排行榜的经济基准列进行构念效度检验;将模型发布日期识别为首要混杂变量并在分析前予以剔除,揭示主导能力轴实质上是时间伪影(先前研究控制规模变量,但剥离日期后计算量对跨代差异解释力微弱);引入留一基准预测效度检验(若基准对保留样本预测无贡献,则对实践者无增量价值);所有分析均遵循哈希固定输入的预设方案,记录所有偏差并如实报告两项失败检验结果。 ## 2 相关工作 构念效度研究有两条主线与本文相关。 第一条将LLM评分视为心理测量数据,延续了用测量心智的工具评估人工系统的范式(Hernández-Orallo,2017),并基于百年观察:认知测试呈现正性流形及普遍因子(Spearman,1904)。Ilić与Gignac(2024)在591个模型的12项测试中复现该流形,平均测试间相关系数达0.73,普遍因子与参数量相关约0.6;Burnell等人(2023)对29个LLM的27项认知任务进行因子分析,将能力解析为三个因子。Ruan等人(2024)进而利用分数矩阵主成分构建能力空间,实现性能预测(包括从非智能体基准预测智能体性能,Zhou等人,2025)。最接近本研究的是Kearns(2026),其对Open LLM排行榜进行量化效度检验:简单因子分析拟合单一因子解释72%公共方差且与参数量相关,对每个分数进行拟合缩放律残差化后,平均项目间相关系数从0.64降至0.48——该残差化方法成为我们日期校正的模板。所有这些研究都以规模为控制变量;而在前沿快照中,我们发现发布日期承担了该角色,计算量在剥离日期后解释力甚微,表明混杂因素已随领域发展演变。 第二条主线将基准视为人工制品。修复基准评估的呼声早于前沿时代(Bowman与Dahl,2021;Kiela等人,2021),整体评估框架(Liang等人,2023)、可复现性指南(Biderman等人,2024)及完整评估科学提案(Weidinger等人,2025)使其日臻完善。Bean等人(2025)审查445个基准发现,仅53.4%提供了构念效度证据,16.0%在模型比较中报告了不确定性估计或统计检验,Miller(2024)通过误差线、Reuel等人(2024)通过质量清单弥补此缺口。时间维度上,Akhtar等人(2026)发现近半数基准已饱和且饱和度随基准龄增长,使得发布日期成为跨动态前沿比较能力时的首要混杂因素。Reuel等人(2025)揭示开发者与第三方之间不均衡的评估分工。现有研究均未单独检验经济基准,也未结合结构检验与样本外预测检验。 ## 3 数据与设计 #### 来源与溯源 主数据集为Artificial Analysis模型排行榜(Artificial Analysis,2026)的快照,于2026年7月6日直接从公开排行榜页面获取并通过SHA-256哈希固定(附录N)。包含548个模型配置的基准评分、发布日期及供应商元数据。次要数据源Epoch AI重要AI模型数据集(Epoch AI,2026)提供部分模型的训练计算量数据,仅用于规模稳健性检验。两个快照均已固定,所有数值均可从固定输入复现。 #### 纳入规则与分析网格 为避免基于研究结果选择基准或模型,我们预先确定覆盖规则:基准需至少60个模型有评分,模型需在13个充分覆盖基准中至少8个有评分。两项阈值在分析计划中设定为参考值,并在覆盖审计中确认不变;该确认仅使用覆盖计数,未涉及分数、相关系数或因子解。附录G展示其各自保护作用。此规则下14项候选基准中13项通过;剔除APEX-Agents(Vidgen等人,2026)(因数据稀疏)并将MMMU-Pro(Yue等人,2025)降为敏感性检验专用,最终保留12项主基准和421个模型配置(含四项经济基准和八项涵盖学术知识、科学编码(Tian等人,2024;Zhu等人,2025)、长上下文检索与指令遵循(Pyatkin等人,2025)的基准)。421行为配置级别(同一基础模型可能对应不同推理或努力设置);方案将按基础模型去重作为稳健性检验R1,但保留配置级别作为主分析(更保守选择)。因经济基准的评分模型数远少于学术核心,采用双网格:96个模型在12项基准均有评分的完整案例网格(经济模块唯一完整且承载全部假设);409个模型在9项通用基准评分的密集网格用于佐证聚类分析(附录K)——该场景更需要大样本量而非经济完整性。此权衡是核心数据设计决策,96模型网格代表了实际运行经济基准的前沿配置集,构成该总体的代表性样本。 #### 预处理与范围 因基准采用不可通约的量纲(主要为准确率分数,含一项幻觉惩罚评分及GDPval的Elo评分),分析前将各基准标准化为零均值单位方差(监督任务中仅使用训练折统计量)。缺失属结构性,采用完整案例分析不进行填补。完整案例网格的Kaiser-Meyer-Olkin取样充分性度量为0.933(远超0.8阈值,Kaiser,1974),Bartlett球形检验显著拒绝原假设(Bartlett,1950),因子分析适用。指标组建模前即存在高度共线性,平均非对角Spearman相关系数ρ=0.79,所有基准对呈正相关,经济基准与学术核心的相关性几乎等同于其内部相关性(附录H);该流形强度至少不低于Ilić与Gignac(2024)在更广泛总体中报告的0.73。我们将研究范围限定于内部效度,即单次横断面聚合分数的关联与预测结构;项目级响应、外部经济影响(如采用率或收入)及饱和动态不在讨论范围内。 ## 4 方法 ### 4.1 任务1:潜结构 每个结构问题对应独立量度,附录D正式阐述各方法及其依据。首个因子占共同方差比例衡量主导性(RQ1),日期校正后该比例变化衡量时间混杂(RQ2),日期校正后载荷模式检验独特性(RQ3)。为固定维度,采用Horn平行分析(Horn,1965),保留特征值超过同形随机数据95百分位的因子,并以碎石图准则(Cattell,1966)作为辅助。
相似文章
两条AI指标分道扬镳:会产生天壤之别吗?
本文分析了不同的AI性能指标(有界 vs 无界)如何决定前沿AI能力是仍集中在富裕行为者手中,还是扩散到较小的模型,这对监管具有重要意义。
能力前沿:基准测试遗漏了82%的模型性能
本文提出了能力前沿(Capability Frontier),这是一个针对模型的帕累托前沿,用于纠正单模型和单次运行评估中的偏差,表明标准基准测试遗漏了高达82%的模型性能,并且集体LLM能力被严重低估。
前沿模型的成长阵痛:当排行榜不再能区分时,接下来该测量什么
本文引入了种群耦合趋势和h场诊断法,分析前沿AI模型在编码与推理能力之间的关系,发现各能力相互协作,但不同实验室侧重点不同。本文提供了测量指南,并预测了基准测试趋于饱和的趋势。
用于衡量前沿AI能力的开放世界评估
本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。
前沿AI在商业学科中的表现:基于案例的知识工作与分析推理基准测试
本文介绍了BusinessCaseBench,这是一个包含18个学科的商业案例问题基准,配有专家评分标准。研究发现,前沿AI模型已经取得高分并显示出快速进步,这对商业教育和专业工作具有重要意义。