避免想太多与想太少:面向课程感知的LLM预算调度
摘要
BACR通过自适应token预算与课程感知调度,防止LLM在简单题上想太多、在难题上想太少,token用量降低34%,准确率最高提升8.3%。
查看缓存全文
缓存时间: 2026/04/23 10:02
# 避免过度思考与思考不足:面向 LLM 的课程感知预算调度
来源:https://arxiv.org/html/2604.19780
###### 摘要
通过延长推理来扩展测试时计算已成为提升大语言模型(LLM)能力的关键范式。然而,现有方法在固定或均匀采样的 token 预算下优化推理,忽略了问题难度与分配算力之间的根本错配,导致简单题“想太多”、难题“想太少”,在多样化推理场景中 token 效率次优。本文提出 Budget-Adaptive Curriculum Reasoning(BACR),一个通过三大协同组件联合优化推理质量与 token 效率的统一框架:
(1) *预算条件统一策略*,将 token 预算作为连续条件信号嵌入,省去解耦的思考与总结策略;
(2) *课程感知预算调度器*,根据实时学习进度自适应地将训练预算分布从简单题迁移到难题;
(3) *截断感知稠密奖励*,通过过程级验证在推理中间步提供细粒度信用分配。
我们进一步提出 Budget-Conditioned Advantage Estimation(BCAE),一种通过将优势基线条件于采样预算来降低方差的新技术。在数学推理基准(MATH、GSM8K、AIME、Minerva Math)上的实验表明,BACR 在所有预算下均稳定超越强基线,在紧预算下准确率最高提升 8.3%,同时相比无约束推理平均节省 34% token。
## 1 引言
大语言模型(LLM)凭借扩展测试时计算的链式思维(CoT)推理在复杂任务上取得显著进展。这一范式进一步扩展到多模态智能,模型在多种模态间融合感知、推理与生成。近期推理模型如 DeepSeek-R1、QwQ 表明,强化学习(RL)可通过优化可验证奖励在长思考轨迹上进一步提升推理能力。然而,这些进展代价高昂:即使简单题,推理模型也动辄生成数千 token,导致推理延迟与算力浪费。
无约束推理的低效催生了 *预算感知推理* 研究,旨在不同 token 约束下仍输出高质量结果。其中,AnytimeReasoner 将推理形式化为随时算法:按先验分布采样预算并截断思考过程,再由独立总结策略从截断思维中提取最佳答案,并在不同预算级别引入稠密可验证奖励,比 GRPO 等固定预算方法信用分配更有效。
尽管优雅,AnytimeReasoner 存在三大局限:
1. 思考与总结策略解耦训练,架构复杂且无法端到端优化;
2. 训练全程预算先验固定,忽视模型能力演化——简单题所需预算随训练减少,难题可能需更长推理;
3. BRPO 仅在同预算组内计算基线,忽略跨预算统计结构,训练方差仍可进一步降低。
本文提出 Budget-Adaptive Curriculum Reasoning(BACR),通过三项协同创新解决上述局限:
- 引入 *预算条件统一策略*,将 token 预算编码为连续嵌入,单策略同时完成思考与答案提取;
- 设计 *课程感知预算调度器*,依据实时难度估计动态调整训练预算分布,把算力投向模型当前做不好的题;
- 开发 *截断感知稠密奖励*,在每个截断点评估中间步质量,提供比二元结果奖励更丰富的监督。
基于上述组件,我们提出 Budget-Conditioned Advantage Estimation(BCAE),通过学习预算条件价值函数扩展 BRPO,实现更低方差的策略梯度。
主要贡献:
- 提出 BACR,统一框架实现预算自适应随时推理,无需独立思考与总结策略;
- 引入课程感知预算调度器,根据问题难度与学习进度自适应迁移训练预算分布,提升样本效率与最终性能;
- 设计截断感知稠密奖励与 BCAE,实现跨所有预算级别的细粒度信用分配与低方差策略梯度;
- 在 MATH、GSM8K、AIME、Minerva Math 上大量实验表明,BACR 取得 SOTA 随时推理性能,紧预算下比 AnytimeReasoner 提升 8.3% 准确率,同精度下节省 34% token。
## 2 相关工作
(略,与原文结构一致,仅将标题与段落翻译为中文,保留引用链接与作者名)
## 3 方法
### 3.1 预备与问题定义
我们考虑在可变 token 预算下训练语言模型策略 πθ。给定问题 q,模型生成推理轨迹 t=(t1,t2,...,tT) 与最终答案 a。在随时推理中,我们希望在所有预算 b∈[bmin,bmax] 上都获得良好性能。
形式化地,令 b 为思考预算(最大思考 token 数)。给定预算 b,模型生成至多 min(|t|,b) 个思考 token,得到截断轨迹 t:b,并从中提取答案,通过可验证奖励 r(q,t:b) 与真值比较。随时推理目标为最大化所有预算上的期望奖励:
J(θ)=Eq∼D,b∼p(b)[Et∼πθ(·|q,b)[r(q,t:b)]],
其中 p(b) 为预算先验,D 为问题分布。
AnytimeReasoner 的局限:
- 固定先验 p0(b) 采样预算;
- 独立训练总结策略 πsum 从 t:b 提取答案;
- 使用 BRPO 分别优化思考与总结策略。
解耦架构使总结器梯度无法改善思考质量;固定先验未随模型能力演化;BRPO 基线仅在同预算组内计算,忽略跨预算结构。
### 3.2 预算条件统一策略
我们提出单一预算条件策略 πθ(·|q,b),在预算 b 内同时生成推理与最终答案。预算信号 b 被编码为连续嵌入并注入生成过程,使策略根据可用算力自适应调整推理深度与总结策略。
具体地,使用可学习嵌入函数 φ:R+→Rd,采用正弦位置编码方式:
φ(b)=W2·SiLU(W1·[sin(b/10000^(2i/d)),cos(b/10000^(2i/d))]_{i=0}^{d/2−1}),
其中 W1,W2∈Rd×d 为可学习投影,d 为模型隐维度。预算嵌入 φ(b) 通过门控机制加到每层隐状态:
hl′=hl+σ(wg⊤hl)·φ(b),
仅需约 2d²+d 额外参数,即可让模型根据预算调节推理行为:预算大时逐步详推,预算小时直接给出简洁答案。
统一策略生成格式:
⟨think⟩t:b⟨/think⟩⟨answer⟩a⟨/answer⟩,思考部分至多 b token。若自然思考长度超 b,则在第 b 个思考 token 强制截断并转入答案生成。该统一形式使答案奖励的梯度可端到端回传至思考与总结全过程,解决 AnytimeReasoner 的第一项局限。相似文章
推理的影子价格:LLM最优预算分配的经济学视角
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。
BAGEN:LLM智能体是否具有预算意识?
本文介绍了BAGEN,一个评估LLM智能体预算意识的框架,将预算估计定义为内部预算和外部预算,并形式化了渐进式区间估计。实验表明,强智能体缺乏预算意识,过于乐观,提前停止可以节省令牌,而训练可以改善告警行为。
TRIAGE:在资源约束下评估大语言模型的前瞻性元认知控制
介绍了TRIAGE,一个在令牌预算下评估大语言模型前瞻性元认知控制的框架,发现它们在跨问题有效分配计算资源的能力上存在显著差距。
Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation
This paper formalizes LLM configuration evaluation as a cost-aware multi-objective bandit problem, proposing a hypervolume-based UCB algorithm for online configuration selection and a cost-aware gap elimination algorithm for Pareto identification, both with theoretical guarantees and empirical validation.
大语言模型搜索代理的推理时预算控制
本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。