轻量级多模态模型能否估计LLM推理性能?一项面向计算最优文档推理的研究
摘要
本研究介绍了BudgetDoc,第一个用于评估文档任务中模型-预算-性能权衡的多模态基准,并开发了DRB,一种轻量级估计器,用于预测推理性能以优化计算分配并降低LLMs成本。
arXiv:2608.18591v1 公告类型:新
摘要:为LLMs统一分配推理推理预算既昂贵又容易受到过度思考惩罚的影响;特别是在视觉布局驱动复杂性的文档任务中。为了解决这个问题,我们引入了BudgetDoc,第一个提供跨三个文档任务的模型-预算-性能权衡显式监督的多模态基准。使用BudgetDoc,我们训练了DRB(Document-Reasoning Balancer),一个约10亿参数的飞行前估计器(SigLIP-2 + Qwen3-0.6B),它预测跨预算水平的序数模型性能,实现了0.753的加权F1。当在五个前沿模型和三个数据集中动态分配推理预算时,DRB在15个配置中的9个中匹配或改进了F1分数,与总是最大预算基线相比,同时大幅降低成本。最后,初步评估表明DRB有潜力推广到跨模型选择。
查看缓存全文
缓存时间: 2026/08/20 10:16
# 轻量级多模态模型能否估算大语言模型推理性能?面向计算最优文档推理的研究
来源:https://arxiv.org/html/2608.18591
Vishal Vaddina,所属机构:Phi Labs, Quantiphi,联系邮箱:{zishan.ahmad, vishal.vaddina}@quantiphi.com
###### 摘要
现代前沿大语言模型在推理时提供可控的推理预算。然而,将这些预算统一应用于所有输入既昂贵且往往适得其反,这种现象通常被称为“过度思考惩罚”。前沿模型提供商提供了飞行中的控制机制来缓解此问题,例如Gemini的动态自动思考,但这些机制依赖于模型对自身难度的评估。最新研究表明这并不足够:名义上更便宜的模型对中,有32%因思考令牌超支而导致实际成本*更高*,对于相同提示的成本方差高达9.7倍。对于文档任务,其难度由视觉布局、表格结构和多模态内容驱动,一个直接读取文档的飞行前估算器比在推理中的模型更能准确判断。解决此问题需要一个*外部*飞行前估算器,能在承诺昂贵推理之前,预测每个样本在给定模型和预算水平下的表现。本研究探讨轻量级多模态模型是否能准确估算大型大语言模型在不同推理预算下的性能。为此,我们引入BudgetDoc——首个提供明确监督信号的多模态基准,用于评估模型-预算-性能权衡,涵盖三个以文档为中心的任务。我们训练了DRB(文档推理平衡器),一个约10亿参数的估算器(结合SigLIP-2与Qwen3-0.6B),能预测任意(文档、提示、模型、预算)配置的7类序数性能标签,在BudgetDoc测试集上达到0.753的加权F1分数。随后,我们将DRB的估算应用于优化五个前沿模型和三个数据集的推理预算:在15种模型-数据集配置中有9种,DRB在保持或提升F1分数的同时,显著降低了成本,效果与始终使用最大预算推理相当。作为次级案例研究,我们探讨了同一估算器是否能泛化到模型选择(涵盖家族内和跨家族配置),发现了令人鼓舞的初步结果,并指出专门的多提供商训练是未来工作的重要方向。
## 1 引言
大语言模型(LLM)发展的一个关键趋势是向*测试时*计算扩展。现代前沿模型(包括OpenAI的GPT-5系列和Google的Gemini系列)提供了用户可控的推理预算,支持不同深度和成本的思维链。其隐含假设是更多推理令牌会带来更好的答案。实践中,这一假设仅在特定条件下成立。
考虑一个需要视觉模式匹配而非多步推导的文档分类查询:强迫模型生成数千个推理令牌不仅无益,反而可能通过鼓励虚假的过度自信推理链而损害性能。我们将此称为“过度思考惩罚”:即额外的测试时计算导致性能下降,或相对于更低成本配置所产生的结果造成金钱浪费。我们对三个基准和五个前沿模型的实证分析证实这种惩罚是系统性的且显著(图1)。
提供商已引入飞行中的控制机制来减少不必要推理支出。Google的Gemini 2.5 Flash提供动态思考模式(默认thinking_budget=-1),根据感知的任务复杂性自动调整推理令牌。OpenAI的GPT-5系列公开了reasoning_effort参数,设有离散层级(低、中、高、极高)。然而,这些控制本质上是*飞行中且自我评估的*:模型根据自身对难度的感知来校准推理,而没有外部对其可能表现的估计。近期研究表明,这不足以消除成本异常。文献[2]评估了八个前沿推理模型,发现32%名义上更便宜的模型对比较中出现*定价逆转*:更便宜列出的模型因不受控的思考令牌消耗而实际成本更高,甚至在单个模型内,相同提示的查询间成本方差高达9.7倍。文献[1]记录了智能编程任务中高达30倍的同题内令牌方差,发现模型对自身使用的自我预测与实际消耗仅呈弱相关(Kendall τ ≤ 0.39)。这些发现表明飞行中的自我评估不足以实现可靠预算控制,从而推动了*外部*、飞行前方法的发展。
通过外部估算解决过度思考惩罚,需要在推理*之前*知道给定模型在特定输入和特定推理预算下的表现。这是一个非平凡的预测问题:性能随预算的变化曲面因文档复杂性、查询类型和模型归纳偏好而异。这引出一个自然的科学问题:轻量级多模态模型能否学习在样本级别估算大型大语言模型的推理性能,从而在API调用时强制实施硬性预算上限?
若答案是肯定的,廉价的飞行前估算过程可以为每个输入选择最小的充分推理预算,以极小的成本实现接近神谕的表现。关键挑战在于估算器必须足够小,使其自身成本相对于它带来的节省可忽略不计。
为严谨研究此问题,我们做出三项贡献:
1. 1. **BudgetDoc数据集**:我们引入首个专为监督LLM性能估算设计的多模态基准。BudgetDoc涵盖三个以文档为中心的任务、两个前沿模型系列和可变推理预算。通过对360个唯一基础样本(每个任务120个)在所有25种模型-预算配置下的穷尽评估,我们生成了一个包含9,000个带标签配对的完整、稠密组合矩阵,精确捕捉模型准确率如何随计算资源变化。
2. 2. **文档推理平衡器(DRB)**:我们训练了一个约10亿参数的多模态估算器,由SigLIP-2视觉编码器、Qwen3-0.6B语言编码器、跨页融合Transformer和轻量级MLP头组成。DRB为任意(文档、提示、模型、预算)元组预测7类序数性能标签,在保留的BudgetDoc测试集上实现0.753的加权F1分数,表明小模型*可以*为大型推理模型学习有意义的性能估计。
3. 3. **下游应用**:我们展示了DRB估算的两个应用:(i)*样本级推理预算优化*(主要):使用DRB预测选择有望达到接近峰值性能的最小预算,在五个前沿模型上实现高达99%的成本削减;(ii)*模型选择*(探索性案例研究):探讨同一估算器是否能泛化到在家族内和跨提供商家族中选择模型,发现了鼓舞人心的结果,为未来专门工作提供了动力。
我们的核心发现是,一个约10亿参数的多模态模型可以有意义地估算前沿大语言模型在文档任务上的推理性能,其估算质量足以通过预算优化带来显著的成本节约。过度思考惩罚在现代模型家族中普遍存在:最大推理预算在准确性和成本上通常是次优的,而样本级性能估算是解决此问题的实用杠杆。
图1:不同模型家族和数据集上的过度思考惩罚。每条线表示平均F1分数随推理预算(Gemini,顶行)或推理努力层级(GPT,底行)的变化。对于Gemini 2.5 Flash在RVL-CIDP上,F1分数*单调下降*,从预算为0时的0.86降至预算为2048时的0.81,因过度分配产生6%的惩罚。GPT-5.2在CheckboxQA上表现出相同模式(low时为0.68 → high时为0.58)。最优预算因任务和模型而异,这推动了样本级估算而非固定上限的研究。
## 2 相关工作
#### 测试时计算扩展。
文献[2]证明,在推理时引导思维链可显著提高LLM在复杂任务上的准确性。后续关于测试时计算扩展定律的研究表明,增加推理令牌与更好的性能相关,但仅对具有足够复杂性的任务成立。我们的工作识别了互补的情形:对于许多输入,过度分配的推理是有害或浪费的。我们将其框架化为一个估算问题:在样本级别预测性能如何随预算变化,而非固定扩展问题。
#### 飞行中的推理控制与定价逆转。
前沿提供商已引入机制来减少不必要的推理支出。Google的Gemini 2.5 Flash使用动态自动思考(默认thinking_budget=-1),根据感知的任务复杂性缩放推理令牌。OpenAI的GPT-5系列公开了reasoning_effort参数,提供从minimal到xhigh的层级。尽管有这些控制,文献[2]表明它们并未消除成本异常:在8个推理模型和12个任务中,32%名义上更便宜的模型对因思考令牌超支而实际成本*更高*,这种“定价逆转”源于思考令牌在单轮任务中占成本差异的98%以上,且相同提示的查询间方差高达9.7倍。文献[1]在智能编程任务中记录了相同现象(同题内方差高达30倍),显示模型自身的自我预测与实际消耗仅呈弱相关(τ ≤ 0.39)。在我们的工作中,我们不改进飞行中的自我评估,而是训练一个外部飞行前估算器,在推理开始*之前*施加硬性预算上限。
#### 大语言模型性能预测与评估。
预测大模型的输出质量是高效推理中的一个新兴关注点。先前工作主要集中在事后评估、自洽性评分或为对齐训练的学习奖励模型。我们的工作有所不同:DRB是一个*事前*估算器,在推理运行*之前*预测性能,基于系统尚未执行的配置(模型、推理预算)。据我们所知,BudgetDoc是首个专为LLM性能估算设计的基准。
#### 大语言模型路由与模型级联。
相关工作线涉及将查询路由到多个模型以平衡成本和质量。这些方法通常根据查询难度将查询路由到强大但昂贵的模型或弱小但廉价的模型。我们的主要贡献在两方面有所不同:(i)我们研究*性能估算*作为核心任务;(ii)我们的主要应用是*固定模型内的预算选择*而非模型选择。我们在探索性案例研究中将估算器作为模型选择器进行了探索,但专门的路由架构超出了本文范围。
#### 使用视觉语言模型进行文档理解。
文档智能得益于能够联合处理渲染页面图像和文本的视觉语言模型。我们的工作基于这些基准,研究文档理解场景中的推理效率,其中输入是多页、视觉丰富且与结构化或开放式查询配对的。这些特性使文档任务成为性能估算的一个特别有趣的测试平台。
#### 主干架构。
DRB借鉴了大型视觉编码器(如SigLIP-2)和高效语言模型(如Qwen3)的成功。Transformer架构是跨页融合模块的基础。
## 3 方法论
### 3.1 BudgetDoc:用于大语言模型性能估算的基准
BudgetDoc是一个监督估算数据集,旨在回答:给定(文档、提示、模型、推理预算)配置,模型将实现何种性能类别?我们通过对两个提供商家族的五个前沿模型,在三个源基准和多个离散推理预算级别上进行穷尽评估来构建它,从而生成一个带标签的配置-结果配对数据集。
#### 源基准。
(i)RVL-CIDP(多类别分类):我们使用Ryerson Vision Lab复杂文档信息处理数据集。为增加任务难度,我们修改了单类别任务,将来自不同类别的三个PDF文件连接成一个多页文档,需要页面级的多类别预测。(ii)TAT-QA(算术推理):表格与文本数据集评估财务报告中半结构化表格和相关文本的混合数值推理。(iii)CheckboxQA(表单复选框提取):我们使用CheckboxQA测试表单理解和复选框状态提取的性能。输入是扫描的表单图像;输出是源自复选框区域的结构化键值对,使其成为区别于分类和算术推理的视觉结构化提取任务。
#### 数据收集与标注。
为构建基准配对,我们从每个源任务中选择恰好120个唯一基础样本(文档及配套提示),总计360个唯一基础上下文。我们对这些样本在所有五个目标模型(三个Gemini模型:gemini-2.5-flash, gemini-3-flash-preview, gemini-3.1-flash-lite-preview;两个GPT模型:gpt-5.1, gpt-5.2)和五个令牌推理预算b ∈ {0, 512, 1024, 1536, 2048}上进行穷尽组合评估。对于GPT家族,预算级别直接映射到努力层级(→none 0 → none, →low 512 → low, 1024/1536 → medium, →high/xhigh 2048 → high/xhigh)。这种穷尽分析扫描了每个底层文档的完整模型-预算性能曲面,生成了一个包含恰好9,000个带标签配对的稠密、封闭组合网格(360基础上下文 × 5模型 × 5预算)。提示使用gemini-2.5-flash-lite进行了意译,以防止语法过拟合。
每个配置的样本级F1分数被离散化为七个相似文章
推理的影子价格:LLM最优预算分配的经济学视角
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
推理计算如何影响前沿LLM的评估
本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。
PoQ-Judge:一种面向去中心化LLM推理中成本感知质量证明的多架构评估框架
介绍了PoQ-Judge,一种采用无参考评判模型(TextCNN、MiniLM、DeBERTa)的多架构评估框架,用于去中心化LLM推理中的成本感知质量证明,实现了与地面真值代理的高相关性,同时消除了对参考答案的需求。