推理计算如何影响前沿LLM的评估

arXiv cs.AI 论文

摘要

本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。

arXiv:2606.17930v1 公告类型: 新 摘要:人工智能评估正转向更困难的任务,这些任务受益于涉及工具使用和迭代问题解决的较长轨迹。因此,性能越来越依赖于测试时可用的计算量和分配(即“推理计算”)。然而,许多评估仍仅报告单一限制性预算下的性能,这意味着低分可能反映的是评估设置,而非模型的底层能力。为验证这一点,我们在覆盖软件工程、数学、医学和网络安全等领域的七个具有挑战性的基准上,评估了多达12个前沿语言模型。我们采用受控设置,结合三种简单的推理扩展干预措施:更大的token预算、上下文压缩以及重复提交尝试,这些尝试由模型自身或最简正确性反馈引导。我们发现了三个主要结果。首先,更大的token预算在多个领域的基准上显著提升了性能,包括网络安全、FrontierMath、Humanity's Last Exam 和 TerminalBench。其次,随着模型进步,固定预算的评估可能越来越低估前沿能力。较新的模型在大预算下能达到更高性能,从而解锁更难的任务并更可靠地解决它们。第三,不同基准中哪些推理扩展方法最有效存在差异:重复提交普遍提升性能,但更大token预算、外部反馈和平行尝试的价值因基准而异。总体而言,我们的结果表明基准得分是协议相关的。因此,我们主张评估应将能力作为推理时计算的函数来报告,明确指定协议选择,并在匹配的预算下,在较大的共享计算范围内比较模型的生成结果,尤其是在安全或政策相关的场景中。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:39

# 推理计算如何塑造前沿大语言模型评估 来源:https://arxiv.org/html/2606.17930 ###### 摘要 AI评估正朝着更困难的任务方向发展,这些任务受益于涉及工具使用和迭代问题解决的更长轨迹。因此,性能越来越依赖于测试时可用的计算量及分配(“推理计算”)。然而,许多评估仍然在单一的限制性预算下报告性能,这意味着低分可能反映了评估设置,而非模型的底层能力。为了验证这一点,我们评估了多达12个前沿语言模型在七个挑战性基准上的表现,涵盖软件工程、数学、医学和网络安全。我们使用了一个受控设置,结合了三种简单的推理扩展干预措施:更大的令牌预算、上下文压缩和重复提交尝试,由模型自身或基于最小正确性反馈引导。我们发现了三个主要结果。首先,更大的令牌预算在多个领域的基准上显著提升了性能,包括网络安全、FrontierMath、人类最后的考试和TerminalBench。其次,固定预算的评估日益可能低估前沿能力,随着模型的进步。更新的模型在大型预算下达到更高的性能,在此它们解锁了更困难的任务并更可靠地解决了它们。第三,不同的基准在哪些推理扩展方法最有帮助上存在差异:重复提交广泛提高了性能,但更大令牌预算、外部反馈和并行尝试的价值因基准而异。总体而言,我们的结果表明基准分数是依赖于协议的。因此,我们主张评估应将能力报告为推理时间计算的函数,明确指定协议选择,并在匹配预算的大共享计算范围内比较模型代际,特别是在安全或政策相关的设置中。 \\AddToShipoutPictureBG \*\\AtPageUpperLeft![[无标题图片]](https://arxiv.org/html/2606.17930v1/images/aisilogo.png)\\NAT@set@cites ## 1引言 随着前沿AI基准的饱和,评估正转向更困难、更长周期的任务,这些任务受益于扩展轨迹、多步规划、工具使用和与复杂环境的交互(Phan et al.,2025 (https://arxiv.org/html/2606.17930#biba.bib48);Glazer et al.,2024 (https://arxiv.org/html/2606.17930#biba.bib35);Folkerts et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib51);Merrill et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib9);Deng et al.,2025 (https://arxiv.org/html/2606.17930#biba.bib23); Kapoor et al.,2026 (https://arxiv.org/html/2606.17930#bib.bib6))。这些任务的性能越来越依赖于评估允许的推理时间计算量(Ord,2025 (https://arxiv.org/html/2606.17930#bib.bib7); Bengio et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib8))。然而,许多评估仍然使用适度的令牌预算,只给模型一次提交解决方案的机会,并报告一个单一的、依赖协议的分数——这相当于在严重时间压力下评估人类专家。这有可能低估模型能力,因为失败可能意味着模型只是耗尽了推理预算,而不是它无法解决任务。在此,我们系统地研究了这种性能随推理时间计算(以下简称“推理扩展”)扩展的现象,处于一个统一的实验框架内。我们评估了跨越多个代际、分别于2025年5月至2026年3月发布的六个前沿语言模型,在软件工程、数学和医学领域的五个挑战性基准上,并且额外使用了来自英国AI安全研究所的两个密切相关的网络安全评估,涵盖了一个重叠的10个模型集合(UK AI Security Institute,2026b (https://arxiv.org/html/2606.17930#biba.bib50);Folkerts et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib51);UK AI Security Institute,2026a (https://arxiv.org/html/2606.17930#biba.bib49))。在这些设置中,我们应用了一个一致的推理扩展协议:扩大的总令牌预算(比已发布的基准默认值高一到三个数量级)、上下文压缩,以及使用或不使用最小正确性反馈的无限提交尝试。这些技术故意保持简单,以便我们建立一个基准,了解简单、通用且可复现的推理扩展方法所能*激发*的下限,而不是旨在使用特定于基准的脚手架来最大化每个模型的性能。 参考说明图1:在七个基准上测试的前沿模型的推理扩展曲线和平台位置。(A) 累积性能作为总使用令牌数(排除LLM评判令牌)的函数,每个(模型、基准、条件)在各自基准上有一条曲线:实线表示全能分数反馈,虚线表示无反馈;每个条件每个任务包含5条独立轨迹。两个网络基准仅使用先前收集的数据,采用与之紧密相似的、仅限全能评分的协议(每个任务5条轨迹),仅以实线显示。y轴报告累积平均分数:*HealthBench*的连续分数在[0,1][0,1]范围内,*The Last Ones*的进展表示为完成的32步的比例,其他情况为二元的0/1任务成功。图例按每个提供者内的时间顺序排列模型。垂直虚线标记每个基准的典型已发布令牌预算(两条线表示一个典型范围);垂直实线标记此评估中施加的令牌限制。(B) 每个推理扩展曲线达到平台的令牌预算,相对于典型已发布预算和测试范围进行分桶:*在典型之前*,*在典型中*(对于具有典型值范围的基准),*在典型之后*(介于典型预算和我们测试的限制之间),或*超出测试范围*(在测试预算内未达到平台)。点代表模型,实心表示五个主要基准上有全能分数反馈,空心表示无反馈;两个网络基准仅贡献了全能分数反馈的点。水平线分隔了Anthropic(顶部)和OpenAI(底部)的模型。 我们发现了三个主要模式: 1. 1.推理扩展是显著的,但高度依赖于基准。某些基准在远超典型已发布令牌预算的情况下仍持续改进——包括FrontierMath、TerminalBench和人类最后的考试(HLE)——而其他基准在我们的协议下显示出较弱边际收益。 2. 2.较新的模型代际通常在大型预算下达到更高的性能,在此它们解锁了更困难的任务并更可靠地解决了它们。这些发现表明,低预算评估可能无法追踪将额外推理时间计算转化为性能方面的进展,因此可能无法激发出仅在更大预算下可见的能力。因此,固定预算分数给出了在更广泛推理时间预算下可达性能前沿的不完整图景,并且这种遗漏可能随着模型进步而增长。 3. 3.推理扩展的收益并非来自单一的普遍干预。基准分数部分取决于关于模型能否以及如何迭代其解决方案,以及计算是分配给单个深层轨迹(“串行”扩展)还是分布在多个较浅轨迹(“并行”扩展)的协议选择。重复提交在所有基准上实质性地提高了性能,而提交正确性的反馈在可以指导持续搜索的地方最为重要(HLE和SWE-Bench Pro)。并行扩展在无状态基准(HealthBench和HLE,不涉及持久交互环境)上最强,在有状态基准上最弱。总之,这些结果表明,不同的任务对不同的推理时间计算分配方式有响应,这意味着激发能力部分依赖于协议。 总体而言,这些发现表明,前沿能力不能完全通过单个推理时间协议下测量的单个基准分数来表征。观察到的性能不仅取决于模型,还取决于给予它的推理时间计算量以及这些计算是如何分配的。因此,评估应该 (i) 将能力报告为推理时间计算的函数,而不是一个单一的固定预算数字,(ii) 将协议选择视为评估设计的一部分并明确报告它们,以及 (iii) 在比较跨代际模型能力时,特别是在安全关键或政策相关背景下,控制计算范围和协议。 ## 背景 现有证据表明,额外的推理时间计算可以改善困难评估的性能,包括网络安全(Folkerts et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib51); Meta Superintelligence Labs,2026 (https://arxiv.org/html/2606.17930#bib.bib11))、软件工程(Ma et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib12); Ding and Zhang,2026 (https://arxiv.org/html/2606.17930#bib.bib13); Epoch AI and METR,2026 (https://arxiv.org/html/2606.17930#bib.bib14))、数学(Muennighoff et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib15); Wu et al.,2024 (https://arxiv.org/html/2606.17930#bib.bib16))、医学(Huang et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib17); Byun et al.,2026 (https://arxiv.org/html/2606.17930#bib.bib18))和其他交互式任务(Anthropic,2026a (https://arxiv.org/html/2606.17930#biba.bib3); Wei et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib20))。推理扩展可以通过一条累积成功曲线来表征,该曲线显示性能作为消耗的令牌数的函数,而不是在单一固定预算下。这些曲线揭示了随着分配更多推理时间计算,成功率是否持续改善,并且前沿模型之间的差异通常在高计算水平下更为明显。如果性能在测试范围内仍在上升,那么评估仅测量了在该协议下可实现性能的一部分,而非完整极限(Folkerts et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib51); Epoch AI and METR,2026 (https://arxiv.org/html/2606.17930#bib.bib14))。这对于跨代际比较尤其重要,因为固定预算评估可能会错过新模型如何使用额外推理时间计算的改进(UK AI Security Institute,2026a (https://arxiv.org/html/2606.17930#biba.bib49))。 微弱或缺失的推理扩展可能意味着要么额外的推理计算在该设置中确实没有帮助,要么这个明显限制是由评估协议引起的。更长的轨迹可能会损害性能(Gema et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib21); Laban et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib22)),并且某些领域可能本质上对额外推理计算的响应较弱(Sprague et al.,2024 (https://arxiv.org/html/2606.17930#bib.bib23))。但弱扩展也可能源于紧张的预算、轮次上限、超时、不良的上下文管理或有限的迭代改进机会(Jurkovic,2026 (https://arxiv.org/html/2606.17930#bib.bib24);Merrill et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib9); Sun et al.,2025 (https://arxiv.org/html/2606.17930#bib.bib25))。这些协议选择限制了轨迹内的*串行深度*以及独立轨迹间的*并行广度*(Wang et al.,2023 (https://arxiv.org/html/2606.17930#bib.bib26); Snell et al.,2024 (https://arxiv.org/html/2606.17930#bib.bib27))。具有相似累积成功曲线的评估实际上可能允许非常不同的搜索、恢复或改进机会。此外,这些曲线中的明显平台可能反映的是轮次上限或超时,而非有效推理时间计算的真实极限。因此,评估是否观察到推理扩展,不能在不考虑协议允许哪些推理时间机会的情况下进行解释。评估额外的推理时间计算使模型能够实现什么,可能需要更分解地分析推理时间计算是如何分配的,以及协议实际启用了哪些形式的搜索、交互或改进(Marchand et al.,2026 (https://arxiv.org/html/2606.17930#bib.bib28))。 两个空白限制了从当前证据中可以得出的结论。首先,现有研究很少在足够宽的推理计算范围内表征性能。这代价高昂但却是必要的,以区分接近饱和与持续改进。曲线的两端都很重要:高计算尾部信息量大,显示了资源充足的参与者可能达到的目标;而低计算区域则信息丰富,关系到可及性和资源较少的滥用。其次,评估者很少在单一框架内跨基准或模型代际应用足够可比的设置。这使得难以将模型和任务导致的差异与脚手架、工具和协议导致的差异分开。然而,可比性并不能保证完全激发:即使在共享框架下,弱扩展仍可能反映真实的能力极限,或者一种未能激发出模型在另一种推理时间计算分配下可能展现出的能力的协议。 ## 2方法 我们的**主要实验**采用了一个完全交叉设计,涉及在两种反馈条件下对五个非网络基准评估的六个前沿模型(表1 (https://arxiv.org/html/2606.17930#S2.T1)),使用一个在Inspect AI中实现的共享ReAct风格框架(Yao et al.,2023 (https://arxiv.org/html/2606.17930#bib.bib29))(UK AI Security Institute,2024a (https://arxiv.org/html/2606.17930#bib.bib30))。对于每个(基准、模型、条件)单元中的每个任务,我们运行5条独立轨迹。每个基准的数据集加载、沙箱配置、评分细节和附加协议细节在章节A.1.1 (https://arxiv.org/html/2606.17930#A1.SS1.SSS1)、A.1.4 (https://arxiv.org/html/2606.17930#A1.SS1.SSS4)和A.1.3 (https://arxiv.org/html/2606.17930#A1.SS1.SSS3)中报告。我们也仅在推理扩展分析中包括了两个先前收集的**网络基准**(UK AI Security Institute,2026b (https://arxiv.org/html/2606.17930#biba.bib50);Folkerts et al.,2026 (https://arxiv.org/html/2606.17930#biba.bib51);UK AI Security Institute,2026a (https://arxiv.org/html/2606.17930#biba.bib49))。这些不属于完全交叉的主设计,并且涵盖了发布日期范围相似的不同模型集合(表1 (https://arxiv.org/html/2606.17930#S2.T1))。它们是在下文第2.2节 (https://arxiv.org/html/2606.17930#S2.SS2)描述的几乎相同的高预算协议下,每个任务运行5条独立轨迹。 ### 2.1模型 对于主基准套件,我们评估了跨越三个代际(从2025年5月到2026年3月)的六个前沿模型,这些模型来自两个模型家族(表1 (https://arxiv.org/html/2606.17930#S2.T1))。在每个家族内,三个连续版本(Opus 4→→4.5→→4.6 和 GPT-5→→5.2→→5.4)使得在固定框架、提示和推理时间计算预算的条件下,进行受控的跨代际比较成为可能。所有模型以高推理努力(Anthropic为xhigh,OpenAI为high)和每次生成调用16,000个推理令牌的预算运行——这是据报道人类最后的考试准确率达到峰值的预算(Center for AI Safety et al.,2026 (https://arxiv.org/html/2606.17930#bib.bib31))。这个推理令牌预算与每个轨迹的总预算分开,并控制每个单独的模型调用。两个网络基准的数据涵盖了不同的

相似文章

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。

您的LLM推理基准测试在误导您

Reddit r/artificial

本文解释了为何LLM推理的合成基准测试可能具有误导性,因为生产流量具有突发性和可变性,并建议使用真实工作负载进行测试以选择正确的推理框架。

LLM推理的有效前沿

Hacker News Top

本文解释了LLM推理中的有效前沿概念,涵盖了延迟、吞吐量和成本之间的权衡,并概述了在部署中管理或提高效率的技术。

InferenceBench:面向AI代理的开放式LLM推理优化基准测试

arXiv cs.AI

InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。