推理税:不同任务类型与部署情境下大语言模型推理的令牌经济学
摘要
本文提出“令牌经济评分”来衡量大语言模型在各类任务中推理的成本效益,揭示任务结构决定效率,并建议根据情境选择性部署推理功能。
查看缓存全文
缓存时间: 2026/08/28 09:33
# 推理税:跨任务类型与部署场景的大语言模型推理令牌经济学 来源:https://arxiv.org/abs/2608.26235 查看PDF(https://arxiv.org/pdf/2608.26235) > 摘要:仅关注准确率的推理型大语言模型基准测试忽略了一个核心部署问题:何时扩展的思考令牌值得其成本?我们引入了令牌经济分数(TES),这是一种边缘基准测试指标,用于衡量推理模型相对于非推理基线的准确率增益,并通过生成令牌倍增系数进行归一化处理。我们针对具有推理开关的模型系列和没有直接非推理对应物的前沿模型定义了配对式和近似式TES变体。随后,我们在涵盖数学、代码生成、科学推理、指令遵循、专业知识、知识检索和研究级物理学的七个基准测试上,对151个模型-基准测试评估运行进行了实证分析。该分析考察了三个部署相关维度:哪些任务结构能产生正边际推理效率、在模型族内增加推理努力如何改变TES,以及部署场景如何影响经济可行性。结果显示,任务结构比名义难度更能预测推理效率:顺序推理链任务(如AIME 2025和LiveCodeBench)表现出高TES,而知识检索任务(如MMLU-Pro)尽管难度较高却呈现低TES。我们还发现更高推理努力水平下存在系统性收益递减现象,包括额外思考反而降低准确率的情况。此外,推理成本占比(RCS)表明推理支出常被内部思考主导,而部署成本倍增系数(DCM)则展示了本地部署如何改变原本昂贵推理工作负载的经济性。这些发现支持一种基准测试驱动的模型选择规则:根据任务类型、努力水平和部署场景选择性启用推理,而非将其视为普遍有益的模式。 ## 提交历史 来自:David Ellison [查看电子邮件 (https://arxiv.org/show-email/16353d23/2608.26235)] **[v1]** 2026年8月26日 周三 17:44:50 UTC (727 KB)
相似文章
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills
This paper proposes amortizing the high token cost of reasoning-mode LLMs by distilling domain-specific skills from existing trajectories into system prompts, recovering most of the reasoning gap on agentic benchmarks while emitting far fewer tokens.
并非所有Token都同等重要:通过强化学习中的Token重要性实现高效LLM推理
本文提出了一个强化学习框架,通过建模Token重要性来选择性地对不重要的Token进行惩罚,同时保留关键推理步骤,采用重要性感知奖励和动态长度奖励来减少冗余,在不牺牲准确性的前提下提高效率。
超越熵:从令牌级分布偏差中学习以提升LLM推理
提出独立组合令牌(ICT)框架,利用令牌logit分布之间的Jensen-Shannon散度识别关键分支点,防止RLVR在LLM推理中的熵坍缩和熵爆炸。在Qwen模型上实现了高达14.9%的pass@4改进。
通过纠正少数决策令牌即可恢复推理能力
本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。
通过自适应结构化非结构化数据的令牌高效数据推理代理
本文提出智能数据解析方法,该方法在LLM推理过程中自适应地结构化非结构化数据,以减少令牌消耗和成本,在保持基准测试准确性的同时实现显著的成本削减。