并非所有错误都相同:基于后果感知的推理计算资源分配
摘要
本文提出了一种基于后果感知的测试时计算资源分配方法,根据预测的失败代价而非单纯的任务难度,将更高风险的软件工程任务路由至更大的计算预算。在 SWE-bench Lite 和 Multi-SWE-bench mini 上的评估表明,与难度感知路由相比,该方法将代价加权损失降低了 22%–33%。
arXiv:2606.04402v1 公告类型:新论文
摘要:现代推理模型可以为不同任务分配不同数量的测试时计算资源,例如思考 token、模型调用次数或计算预算。现有方法通常根据预测的任务难度来驱动资源分配,在预期能够提升准确率的地方投入更多计算。这隐含地假设所有失败的代价相同,因为准确率目标对每个任务的权重是相等的。然而,这一假设在实际部署中并不成立:日志消息中的一处错别字与导致生产数据库损坏的迁移操作在基准测试中同样算作一次失败,但二者在现实世界中的代价有着本质区别。为填补这一空白,我们提出了基于后果感知的测试时计算资源分配方法。我们不再仅依据预测难度进行计算路由,而是使用一个轻量级预测器,根据 issue 文本估计任务解决错误时可能产生的代价。调度器随后在相同的总预算下,将高后果任务路由至更大的计算层级或更高的思考预算。我们在 SWE-bench Lite 上进行了主要实验,并在 Multi-SWE-bench mini 上评估了跨数据集的泛化能力,共涵盖 700 个软件工程任务。实验结果表明,在多种标注方式下,后果严重性与任务难度近似正交,且当前的思考模型并未根据后果严重程度进行充分的计算分配。此外,我们的仅基于 issue 的预测器在 300 个 SWE-bench 任务中从未将高后果任务误判为低后果任务。在相同计算预算下,我们的后果感知调度器相较于难度感知路由,将代价加权损失降低了 22% 至 33%;其中,按边际效用信号对每任务代价加权进行路由的优先级感知变体超过了 30% 的降幅,而其可部署的预测器驱动版本保留了超过 90% 的理论上限收益。
查看缓存全文
缓存时间: 2026/06/05 02:07
# 并非所有错误生而平等:后果感知的推理算力分配
来源:https://arxiv.org/html/2606.04402
Jingbo Wen¹ Liang He²,∗ Ziqi He¹ ¹悉尼大学 ²中国科学院上海光学精密机械研究所 hel@siom\.ac\.cn ∗通讯作者
###### 摘要
现代推理模型可以为不同任务分配不同数量的测试时算力,例如思考 token、模型调用次数或算力预算。现有方法通常依据预测的任务难度来驱动分配,在预期能提升准确率的地方投入更多算力。这隐含地假设所有失败的代价相同,因为准确率目标对每个任务一视同仁。然而,这一假设在实际部署中并不成立:日志消息中的一个笔误,与一次损坏生产数据库的迁移操作,在基准测试中都只算作一次失败,但它们的真实代价有着本质差异。为填补这一空白,我们提出了后果感知的测试时算力分配方法。我们不再仅凭预测难度来路由算力,而是使用一个轻量级预测器,在任务求解之前直接从问题描述中估计任务出错的代价。调度器随后在相同总预算下,将高后果任务路由到更大的算力层级或更高的思考预算。我们在 SWE-bench Lite 上进行主要实验,并在 Multi-SWE-bench mini 上评估跨数据集表现,共覆盖 700 个软件工程任务。结果表明,在各类标注方式下,后果与难度近似正交,且现有思考模型并未充分依据后果来分配算力。此外,我们的仅凭问题描述的预测器在 300 个 SWE-bench 任务中从未将高后果任务误分类为低后果任务。在相同算力预算下,我们的后果感知调度器相比难度感知路由将成本加权损失降低了 22%–33%;其中,优先级感知变体——按每任务代价乘以边际效用信号进行路由——降幅超过 30%,其可部署的预测器驱动版本保留了超过 90% 的 oracle 增益。值得注意的是,难度感知路由的表现甚至不如随机路由,原因在于最难的任务在任何层级都无法求解。
## 1 引言
现代推理模型,如 OpenAI 的 o 系列、DeepSeek-R1、Anthropic 的 Claude(扩展思考模式)以及 Qwen3-Thinking,可以决定对每个输入投入多少测试时算力\(Li et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib11)\)。在实践中,它们对不同任务的思考时长各异,通常对看起来更难的输入产生更长的推理链\(Alomrani et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib12); Zhu and Li, 2025 (https://arxiv.org/html/2606.04402#bib.bib13)\)。同样的原则在自适应测试时算力中被明确追求,其中学习型路由器\(Damani et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib2)\)、算力-难度缩放定律\(Snell et al., 2024 (https://arxiv.org/html/2606.04402#bib.bib1)\)和置信度驱动的提前停止\(Manvi et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib3)\)机制各异,但遵循同一规则——更难的任务理应获得更多算力。
这一原则对于在算力预算下优化平均准确率的基准测试而言是自然的。在这类设置中,每个任务对最终得分贡献一个单位,每次失败被假定为可互换的\(Alomrani et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib12)\)。然而,实际部署并非如此,这一假设通常并不成立。试想一个代码助手在同一天产生的两次失败:一个是日志消息中的笔误,另一个是在竞态条件下悄无声息地损坏生产表的数据库迁移。基准测试将两者都记为一次失败,但在部署中它们的代价天差地别:即使两者修复难度相同,防止迁移错误也值得投入更多算力。
这一部署失配暴露了当前 LLM 自适应算力目标中缺失的一项。最接近的先前框架是理性元推理\(Russell and Wefald, 1991 (https://arxiv.org/html/2606.04402#bib.bib4); Hay et al., 2012 (https://arxiv.org/html/2606.04402#bib.bib5); Sabbata et al., 2024 (https://arxiv.org/html/2606.04402#bib.bib6)\),它将计算视为一种其价值取决于预期效用的行动。从这一角度来看,额外的推理仅在其预期减少的下游损失超过计算代价时才有价值\(Alomrani et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib12); Sayin et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib16)\)。然而,自适应算力的现代 LLM 实现通常将这一效用项压缩为统一的准确率目标\(Li et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib11)\)。因此,我们超越难度感知分配,将后果感知分配定式为一个成本加权问题:对于每个任务,调度器应选择一个算力层级,在额外算力的代价与预期后果加权误差之间进行权衡\(Qu, 2026 (https://arxiv.org/html/2606.04402#bib.bib15)\)。当所有任务的错误代价相等时,该目标退化为标准的算力预算下准确率最大化\(Alomrani et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib12)\)。但当错误代价各异时,仅凭难度不再是充分的路由信号。
参见图1:三款当代思考模型未能充分依据后果分配算力。每个面板展示了一个模型在 SWE-bench Lite 任务上实际思考时长与我们的后果标签之间的关系。Qwen3-8B 的思考时长与后果不相关(ρ=0.002)。Qwen3-VL-8B-Thinking 将 99.3% 的任务固定在 8192 token 上限处。Claude Sonnet 4.5 扩展思考模式显示出统计显著但微弱的后果敏感性(ρ=0.20,p=0.008,n=171)。在三种不同的分配机制下,没有任何模型表现出足够的后果敏感性,足以解释本文后续观察到的后果感知路由的收益。人们或许希望足够强大的推理模型已经能够隐式地习得这一区别。如果高后果任务自然地引发更长的推理链,那么显式的代价信号将是不必要的。我们在图1 (https://arxiv.org/html/2606.04402#S1.F1)中对三款当代思考模型在 SWE-bench Lite 上进行审计,直接检验了这一可能性。结果揭示了三种不同的失效模式:Qwen3-8B 的思考时长有所变化,但该变化与后果基本不相关(ρ=0.002);Qwen3-VL-8B-Thinking 在 99.3% 的任务上达到 8192 token 上限,几乎没有任务特定分配的空间\(Pan et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib17)\);Claude Sonnet 4.5 扩展思考模式显示思考时长与后果之间存在统计显著关系(ρ=0.20,p=0.008,n=171),但效果微弱:高后果任务仅比低后果任务多获得 20.5% 的思考量。由此可见,现有思考模型要么没有后果信号,要么陷入饱和,要么仅具有微弱的后果敏感性\(Liu et al., 2025 (https://arxiv.org/html/2606.04402#bib.bib18)\)。
受此差距的驱动,我们提出了后果感知的测试时算力分配方法。该方法将两个常被混为一谈的决策分离开来\(Shirkavand et al., 2026 (https://arxiv.org/html/2606.04402#bib.bib19)\)。首先,一个轻量级预测器在任务求解之前,直接从问题描述中估计错误的部署代价。其次,调度器利用这一预测后果,在与难度型基线相同的总算力预算下,将高后果任务路由到更大的算力层级或更高的思考预算。推理模型本身无需重新训练;干预完全在调度层进行。
本文的其余部分分四步构建实证依据。
- (1)**后果不等于难度,也不是置信度信号的变体。** 我们在 300 个 SWE-bench Lite 任务上进行主要分析,并在 400 个 Multi-SWE-bench mini 任务上评估跨数据集表现。在基于规则、LLM 含补丁、仅问题描述和人工多数投票等各类标注方式下,后果与难度保持近似正交。此外,在同时控制难度和跨模型通过率方差之后,后果仍能额外解释 26.4 个百分点的成本加权边际价值(+55.7% 相对提升;§3 (https://arxiv.org/html/2606.04402#S3),§8 (https://arxiv.org/html/2606.04402#S8))。
- (2)**现有思考模型对后果的感知不足。** 图1 (https://arxiv.org/html/2606.04402#S1.F1)的审计揭示了三种不同的分配模式:Qwen3-8B 中无后果信号、Qwen3-VL-8B-Thinking 中近乎普遍的饱和,以及 Claude Sonnet 4.5 中微弱但不足的后果敏感性(§4 (https://arxiv.org/html/2606.04402#S4))。
- (3)**后果可在求解之前预测。** 仅看问题描述和文件路径的 Qwen3-8B 预测器,与 Qwen3-8B 含补丁参考标注的 Cohen's κ=0.572。跨模型 Claude 仅问题预测器达到 κ=0.379。关键在于,在 300 个 SWE-bench Lite 任务中,两个预测器均未将高后果任务误分类为低后果任务,从而避免了最危险的欠分配错误(§5 (https://arxiv.org/html/2606.04402#S5))。
- (4)**后果感知路由改善了成本加权分配,优先级感知路由进一步提升效果。** 在 16 模型 SWE-bench 算力层级基准的匹配算力条件下,后果路由相比难度感知路由大幅降低了成本加权损失。将预测后果与估计边际收益相结合的优先级感知变体将成本加权损失降低了 30% 以上,同时保留了超过 90% 的 oracle 增益。同样的分析也解释了为何难度感知路由可能表现不如随机路由:最难的任务在所有可用层级中往往边际收益最低,因为它们在任何层级都无法求解(§7 (https://arxiv.org/html/2606.04402#S7),§8 (https://arxiv.org/html/2606.04402#S8))。
## 2 相关工作
**自适应测试时算力。** 越来越多的研究探讨语言模型对每个输入应投入多少算力。Snell et al.\(2024 (https://arxiv.org/html/2606.04402#bib.bib1)\)分析了不同测试时扩展策略的有效性,并推导出在固定推理预算下依赖难度的算力最优策略。Damani et al.\(2025 (https://arxiv.org/html/2606.04402#bib.bib2)\)训练奖励预测器,根据预期准确率增益分配算力。Manvi et al.\(2025 (https://arxiv.org/html/2606.04402#bib.bib3)\)利用 token 级置信度,在模型已足够自信时提前停止生成。尽管这些方法在实现上有所不同,但它们共享相同的底层目标:在预期能提升平均准确率的地方投入算力。我们的工作提出了一个互补的问题:当两个任务的预期准确率增益相近,但失败代价差异悬殊时,以准确率为驱动的路由器会将二者视为等同,而面向部署的调度器则不应如此。因此,我们保持推理模型不变,将路由信号从预测难度或置信度改为预测后果。
**理性元推理。** 将计算视为有代价行动的决策理论视角可追溯至理性元推理\(Russell and Wefald, 1991 (https://arxiv.org/html/2606.04402#bib.bib4); Hay et al., 2012 (https://arxiv.org/html/2606.04402#bib.bib5)\)。在该框架中,额外计算仅在其预期效用超过计算代价时才有意义。这一视角与我们的定式高度契合:一个任务是否值得更多算力,不仅取决于算力能在多大程度上改善答案,还取决于错误的代价有多高。近期工作已开始将理性元推理应用于大型语言模型\(Sabbata et al., 2024 (https://arxiv.org/html/2606.04402#bib.bib6)\)。然而,在大多数 LLM 自适应算力设置中,效用被操作化为准确率、奖励或置信度,而非任务相关的错误代价。
**代价敏感学习与选择性预测。** 代价敏感学习研究非对称错误代价下的分类问题\(Elkan, 2001 (https://arxiv.org/html/2606.04402#bib.bib7)\),而选择性预测允许模型在不确定时选择弃权\(Geifman and El-Yaniv, 2017 (https://arxiv.org/html/2606.04402#bib.bib8)\)。两类研究都承认错误并非可互换。差异在于代价信号的使用位置:代价敏感学习通常改变训练目标或决策规则,选择性预测则决定是否回答。相比之下,我们在算力分配时使用代价信号:模型仍然回答每个任务,但调度器决定任务在回答前应获得多少算力。这使该方法无需重新训练即可与现有推理模型兼容。
**软件工程基准测试。** 我们使用 SWE-bench Lite\(Jimenez et al., 2024 (https://arxiv.org/html/2606.04402#bib.bib9)\)作为主要测试平台,并使用 Multi-SWE-bench\(Zan et al., 2026 (https://arxiv.org/html/2606.04402#bib.bib10)\)的 400 个任务子集进行跨数据集验证。软件工程任务是后果感知分配的天然应用场景,因为它们同时具有任务难度的大幅变化和部署风险的大幅变化。文档笔误、解析器边界情况、权限漏洞和数据库迁移错误,在基准测试中都可能以单个通过/失败任务的形式出现,但它们的真实后果差异显著。问题报告、文件路径和金标补丁的可获得性,也使我们能够将部署时仅基于问题描述的预测与含补丁的后果标签进行比较。
## 3 后果的定义与度量
我们首先将后果定义为任务的一种可测量属性,描述三条独立的标注流程,并证明后果在统计上与难度和基于模型分歧的置信度均不同。
**定义。** 我们将任务的后果定义为 {0, 1, 2} 中的一个序数标签,反映模型给出错误修复时所实现的部署代价:
- **0(低)。** 外观、格式、文档或日志消息错误。这些错误对用户可见,但不会损坏下游系统。
- **1(中)。** 功能性但局部受限的 bug,例如 API 返回错误值、某功能在边界情况下崩溃,或临时不可用。错误可被观察到,且可在本地恢复。
- **2(高)。** 静默数据损坏、安全或权限绕过、不可逆操作(删除/覆盖/迁移),或被下游无感知地消费的错误结果。错误既无法被及时观察,也无法恢复,是代价最高的一类错误。
**标注流程。** SWE-bench Lite(N=300)和 Multi-SWE-bench mini(N=400)中的每个任务通过三条独立流程进行标注:(i)基于规则的标注器,使用文件路径和金标补丁中的词汇模式(例如 delete、auth、migration);(ii)LLM 含补丁评判器(Qwen3-8B),可观察问题描述、金标补丁和修改文件,作为参考标注;(iii)仅凭问题描述的预测器,在任务求解之前仅基于问题文本进行预测,用于模拟部署时的早期路由决策。相似文章
努力是上限而非旋钮:推理预算不会调节人类与大推理模型之间的认知成本对齐
本文测试了改变推理时的推理努力是否会影响大推理模型思维链长度与人类反应时间之间的对齐。结果表明,对齐对于努力扰动具有不变性,表明这是一种训练时实现的成就。
对于AI推理的“只需增加更多算力”的论点正变得越来越令人厌倦。
对AI推理扩展论点的一个批判性观点,认为自回归LLM无法仅通过增加计算量来实现正确性,并强调替代架构如EBM和形式验证在关键应用中更为优越。
重新思考逐步模型路由:一种面向表格推理的成本高效视角
本文提出EcoTab,一种表格感知的逐步路由框架,分别估计表格标记和文本标记的不确定性,以动态地在小型和大型模型之间路由推理步骤,在表格推理任务上实现了更好的准确性与效率权衡。
风险链条:大型推理模型中的安全失效及通过自适应多原则引导进行缓解
本文研究了大型推理模型中的安全失效问题,即尽管最终答案安全,但推理轨迹中仍会出现有害内容,并提出了一种自适应多原则引导方法来缓解这些风险。
重新思考还是思考更久?面向预算感知推理的选择性验证
介绍了SEVRA,一种用于预算感知推理的选择性验证控制器,它决定何时接受模型的初始答案,何时在验证上花费额外计算资源,在MATH500和GSM8K等基准上提高了准确率并减少了不必要的token。