When2Think:面向高效混合推理模型的难度感知长度控制学习

Hugging Face Daily Papers 论文

摘要

When2Think 是一个后训练框架,能根据问题难度在大型推理模型中动态分配计算资源,从而在数学基准测试中优化准确性与效率的权衡。

大型推理模型在复杂任务上表现优异,但存在系统性的效率缺陷:常对简单问题过度思考,对难题则思考不足。现有的统一长度惩罚或固定路由方案会带来效率损耗,以牺牲简单实例的计算为代价换得的减少,却导致了难题上的准确性损失。我们将高效推理建模为一个实例自适应的计算分配问题,并提出了When2Think,一个面向混合推理的后训练框架,它能基于问题难度动态分配计算资源。本方法引入了实例级难度感知控制机制,一种奖励塑造机制,它利用预计算的参考统计量来调节推理深度。结合基于验证器的奖励与批次标准化的优势值,该机制实现了无需学习奖励模型或在线参考模型查询的稳定无评论员优化。When2Think鼓励对简单实例直接作答,同时保留对复杂实例的深度推理,从而学习何时使用“快思考”模式与“慢思考”模式。在数学基准测试上的实验表明其在准确性-效率权衡上表现更优:在AIME24上,Pass@3提升了10.0%,同时相较于基础模型,token使用量减少了27.9%;在AIME25上,When2Think达到了40.0%的Pass@3,优于基于压缩和纯路由的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/09/18 02:58

论文页面 - When2Think:面向高效混合推理模型的难度感知长度控制

来源:https://huggingface.co/papers/2609.19671

摘要

大型推理模型在复杂任务上表现强劲,但存在系统性的效率问题:它们常常对简单问题过度思考,而对困难问题思考不足。基于统一长度惩罚或固定路由的现有方法会导致效率代价,即在简单问题上减少计算却以牺牲难题准确率为代价。我们将高效推理表述为实例自适应计算分配问题,并提出了 When2Think——一种用于混合推理的后训练框架,它能根据问题难度动态分配计算资源。我们的方法引入了实例级难度感知控制,这是一种奖励塑造机制,利用预计算的参考统计数据来调节推理深度。结合基于验证器的奖励和批量标准化优势值,该控制机制实现了稳定的无评论员优化,无需学习奖励模型或在线参考模型查询。When2Think 在简单实例上鼓励直接回答,同时在困难实例上保留扩展推理,从而学会何时使用系统一(不思考)与系统二(思考)。在数学基准测试上的实验表明,其准确性-效率权衡得到改善:在 AIME24 上,Pass@3 相对于基线模型提升了 10.0%,同时令牌使用量减少了 27.9%;在 AIME25 上,When2Think 达到了 40.0% 的 Pass@3,超越了仅压缩和路由的基线方法。

查看 arXiv 页面 (https://arxiv.org/abs/2609.19671) 查看 PDF (https://arxiv.org/pdf/2609.19671) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.19671)

引用本文的模型数量:0

无模型链接本文 在模型的 README.md 中引用 arxiv.org/abs/2609.19671 以从此页链接。

引用本文的数据集数量:0

无数据集链接本文 在数据集的 README.md 中引用 arxiv.org/abs/2609.19671 以从此页链接。

引用本文的空间数量:0

无空间链接本文 在空间的 README.md 中引用 arxiv.org/abs/2609.19671 以从此页链接。

包含本文的收藏集数量:1

相似文章

DyCon: 通过演化难度建模的动态推理控制

arXiv cs.AI

本文介绍了DyCon,一种无需训练的框架,利用步骤级嵌入来建模演化的任务难度,并动态控制大型推理模型(LRMs)的推理深度,有效减少过度思考,在不牺牲准确性的情况下提高效率。