推理税:不同任务类型与部署情境下大语言模型推理的令牌经济学

arXiv cs.AI 论文

摘要

本文提出“令牌经济评分”来衡量大语言模型在各类任务中推理的成本效益,揭示任务结构决定效率,并建议根据情境选择性部署推理功能。

arXiv:2608.26235v1 新文章类型 摘要:仅以准确率评估具备推理能力的大语言模型,忽略了关键的部署问题:扩展思考令牌何时值得其成本?我们提出“令牌经济评分”,这是一种衡量推理模型相较于非推理基线准确率提升的边际基准指标,通过生成令牌倍数进行标准化。针对具有推理开关的模型系列和缺乏直接非推理对照的前沿模型,我们定义了配对与近似TES变体。随后对涵盖数学、代码生成、科学推理、指令遵循、专业知识、知识记忆与研究级物理的七个基准上的151次模型基准评估运行进行实证分析,考察三个部署维度:哪些任务结构能产生正向边际推理效率、模型系列中推理努力程度如何影响TES、以及部署情境如何改变经济可行性。结果显示,任务结构比名义难度更能预测推理效率:如AIME 2025和LiveCodeBench等顺序推理链任务呈现高TES,而MMLU-Pro等知识记忆任务尽管难度较高却显示低TES。我们还发现更高推理努力层级存在系统性收益递减现象,包括额外思考反而降低准确率的情况。此外,推理成本占比显示推理开销常由内部思考主导,而部署成本倍数则揭示本地部署如何改变高成本推理负载的经济模型。这些发现支持基于基准测试的模型选择规则:应根据任务类型、努力程度与部署情境选择性启用推理,而非视其为普适性增强模式。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:33

# 推理税:跨任务类型与部署场景的大语言模型推理令牌经济学
来源:https://arxiv.org/abs/2608.26235
查看PDF(https://arxiv.org/pdf/2608.26235)

> 摘要:仅关注准确率的推理型大语言模型基准测试忽略了一个核心部署问题:何时扩展的思考令牌值得其成本?我们引入了令牌经济分数(TES),这是一种边缘基准测试指标,用于衡量推理模型相对于非推理基线的准确率增益,并通过生成令牌倍增系数进行归一化处理。我们针对具有推理开关的模型系列和没有直接非推理对应物的前沿模型定义了配对式和近似式TES变体。随后,我们在涵盖数学、代码生成、科学推理、指令遵循、专业知识、知识检索和研究级物理学的七个基准测试上,对151个模型-基准测试评估运行进行了实证分析。该分析考察了三个部署相关维度:哪些任务结构能产生正边际推理效率、在模型族内增加推理努力如何改变TES,以及部署场景如何影响经济可行性。结果显示,任务结构比名义难度更能预测推理效率:顺序推理链任务(如AIME 2025和LiveCodeBench)表现出高TES,而知识检索任务(如MMLU-Pro)尽管难度较高却呈现低TES。我们还发现更高推理努力水平下存在系统性收益递减现象,包括额外思考反而降低准确率的情况。此外,推理成本占比(RCS)表明推理支出常被内部思考主导,而部署成本倍增系数(DCM)则展示了本地部署如何改变原本昂贵推理工作负载的经济性。这些发现支持一种基准测试驱动的模型选择规则:根据任务类型、努力水平和部署场景选择性启用推理,而非将其视为普遍有益的模式。

## 提交历史

来自:David Ellison [查看电子邮件 (https://arxiv.org/show-email/16353d23/2608.26235)] **[v1]** 2026年8月26日 周三 17:44:50 UTC (727 KB)

相似文章

通过纠正少数决策令牌即可恢复推理能力

arXiv cs.AI

本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。