When2Think:面向高效混合推理模型的难度感知长度控制学习
摘要
When2Think 是一个后训练框架,能根据问题难度在大型推理模型中动态分配计算资源,从而在数学基准测试中优化准确性与效率的权衡。
查看缓存全文
缓存时间: 2026/09/18 02:58
论文页面 - When2Think:面向高效混合推理模型的难度感知长度控制
来源:https://huggingface.co/papers/2609.19671
摘要
大型推理模型在复杂任务上表现强劲,但存在系统性的效率问题:它们常常对简单问题过度思考,而对困难问题思考不足。基于统一长度惩罚或固定路由的现有方法会导致效率代价,即在简单问题上减少计算却以牺牲难题准确率为代价。我们将高效推理表述为实例自适应计算分配问题,并提出了 When2Think——一种用于混合推理的后训练框架,它能根据问题难度动态分配计算资源。我们的方法引入了实例级难度感知控制,这是一种奖励塑造机制,利用预计算的参考统计数据来调节推理深度。结合基于验证器的奖励和批量标准化优势值,该控制机制实现了稳定的无评论员优化,无需学习奖励模型或在线参考模型查询。When2Think 在简单实例上鼓励直接回答,同时在困难实例上保留扩展推理,从而学会何时使用系统一(不思考)与系统二(思考)。在数学基准测试上的实验表明,其准确性-效率权衡得到改善:在 AIME24 上,Pass@3 相对于基线模型提升了 10.0%,同时令牌使用量减少了 27.9%;在 AIME25 上,When2Think 达到了 40.0% 的 Pass@3,超越了仅压缩和路由的基线方法。
查看 arXiv 页面 (https://arxiv.org/abs/2609.19671) 查看 PDF (https://arxiv.org/pdf/2609.19671) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.19671)
引用本文的模型数量:0
无模型链接本文 在模型的 README.md 中引用 arxiv.org/abs/2609.19671 以从此页链接。
引用本文的数据集数量:0
无数据集链接本文 在数据集的 README.md 中引用 arxiv.org/abs/2609.19671 以从此页链接。
引用本文的空间数量:0
无空间链接本文 在空间的 README.md 中引用 arxiv.org/abs/2609.19671 以从此页链接。
包含本文的收藏集数量:1
相似文章
LEAD:用于大型语言模型的长度高效自适应与动态推理
LEAD通过使用正确性-效率权衡的在线校准和自适应的问题特定长度目标,在训练过程中动态调整推理效率,提高了数学推理的准确性并减少了输出长度。
DyCon: 通过演化难度建模的动态推理控制
本文介绍了DyCon,一种无需训练的框架,利用步骤级嵌入来建模演化的任务难度,并动态控制大型推理模型(LRMs)的推理深度,有效减少过度思考,在不牺牲准确性的情况下提高效率。
Lightning Weave: 通过能力组合提升推理模型的准确率-效率前沿
本文介绍了Lightning Weave,一个通过在线策略蒸馏将独立训练的推理能力组合成单一高效模型的框架,从而在数学和代码任务中提高准确率并减少令牌使用。
A*-Thought-V2:通过LLM几何动力学实现高效潜在推理
A*-Thought-V2将思维链推理建模为隐藏状态轨迹,利用几何动力学将非必要步骤压缩为潜在令牌,从而提升LLM推理的准确性和效率。
高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型
本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。