AdaThinking-E: 用于自适应思考的单令牌熵调节
摘要
本文提出了AdaThinking-E,这是一个强化学习框架,利用单令牌熵调节使多模态大型语言模型实现自适应思考,从而在复杂任务上提高准确性,在简单任务上提高效率。
arXiv:2608.26141v1 公告类型:新
摘要:多模态大型语言模型通过引入显式思考过程,展示了强大的文档推理能力。虽然这一能力显著提高了在挑战性任务上的性能,但当前模型将这种深度推理统一应用于所有问题,导致在简单任务上产生不必要的计算开销。这不仅降低了用户体验,还对基准数据集上的准确性产生负面影响。我们认识到,关键需求是自适应思考机制,能够根据问题复杂度智能地确定何时启动推理。为解决此问题,我们提出AdaThinking-E,一个新颖的强化学习框架,通过单令牌熵调节学习自适应思考。我们的关键洞察是,模型在决定是否启动思考时的置信度,可以通过关键决策令牌的预测概率分布的熵分析来量化。这一观察启发了我们的熵调控奖励机制:训练过程自然地从高熵探索过渡到低熵收敛,其中模型试验不同的思考策略,最终形成自信且可泛化的决策策略。至关重要的是,这种方法使模型能够内在地发现何时思考,无需手动干预或外部难度标签。大量实验表明,我们的方法使模型在多样化文档任务中,既能准确处理复杂问题,又能高效处理简单问题。
查看缓存全文
缓存时间: 2026/08/28 09:20
# AdaThinking-E:用于自适应思维的单令牌熵调节
来源:https://arxiv.org/html/2608.26141
11institutetext: 美团,11email:{wangzining03,chenboming,guozhentao,zhoukai03}@meituan\.com
22institutetext: 上海交通大学计算机科学学院人工智能研究所 MoE 人工智能重点实验室,22email:gtk0615@sjtu\.edu\.cn
33institutetext: 中国科学院自动化研究所 MAIS&NLPR
管彤坤*
\* https://orcid.org/0000-0003-3346-8315
陈博明*
\* https://orcid.org/0009-0003-1248-2430
郭振涛 https://orcid.org/0009-0000-0242-4059
刘建强
金超
段晨
周凯
严鹏飞
沈伟
杨晓康
###### 摘要
多模态大语言模型通过引入显式的思维过程,已展现出强大的文档推理能力。虽然这种能力显著提升了模型在复杂任务上的表现,但现有模型将这种深度推理统一应用于所有问题,导致简单任务产生不必要的计算开销。这不仅降低了用户体验,还对基准数据集上的准确性产生负面影响。我们认识到,迫切需要一种自适应思维机制,能够根据问题复杂性智能判断何时启动推理。为此,我们提出了 AdaThinking-E,这是一个通过单令牌熵调节来学习自适应思维的新型强化学习框架。我们的核心见解是,模型在决策是否启动思维过程时的置信度,可以通过关键决策令牌预测概率分布的熵分析来量化。这一观察启发了我们的熵调控奖励机制:训练过程自然地从高熵探索(模型尝试不同的思维策略)过渡到低熵收敛(形成自信且可泛化的决策策略)。至关重要的是,这种方法使模型能够内在地发现何时需要思考,而无需人工干预或外部难度标签。大量实验表明,我们的方法使模型在处理多样化文档任务时,既能准确解决复杂问题,也能高效处理简单问题。代码可在 https://github.com/PriNing/AdaThinking-E 获取。
00footnotetext: *同等贡献。✉通讯作者。
## 1 引言
多模态大语言模型(MLLMs)[ChatGPT, GPT-4, GPT-4V] 在文档理解方面展现了卓越的能力,涵盖从视觉文本识别到解决立体几何问题、解释复杂布局、回答逻辑密集型问题等复杂推理。这一进展主要得益于强化学习 [jaech2024openai, wei2022chain, shao2024deepseekmathpushinglimitsmathematicalgrpo] 的最新发展,它使模型能够为复杂问题生成分步解释。参见图例图1:自适应思维模型中模式切换令牌的不同 RL 训练范式:(a) 外部控制思维,提示明确指定输出模式(思维或非思维);(b) 现有自适应思维,模型通过特殊令牌在思维和非思维模式间自适应切换,使用涉及主观人类判断的规则奖励值来学习何时思考;(c) 我们提出的 AdaThinking-E,模式切换令牌和响应令牌被分开优化。采用熵调节来鼓励模型从自主探索过渡到自信的决策,摆脱主观人类偏见,从而实现真正的自适应思维。
然而,许多日常问题并不需要如此深度的推理。考虑一个简单问题,例如“这份备忘录是由哪个部门签发的?”,答案可以直接从文档标题中提取。当对所有问题都应用深度推理时,它们在简单查询上会产生不必要的计算开销,甚至可能因过度思考而引入幻觉。因此,我们认为文档 MLLM 需要一种自适应思维机制 [zhang2505adaptthink, kwaikeyeteam2025kwaikeyevltechnicalreport, yang2025r, tu2025learning],根据问题复杂性智能判断何时启动思维过程。这种自适应能力将使模型在处理复杂问题时保持准确性,在处理简单问题时保持高效。
尽管其重要性,自适应思维在很大程度上仍未得到解决。当前主流 MLLMs [xu2025chain, bercovich2025llama, chen2024not, coreteam2025mimovltechnicalreport] 依赖人工干预进行模式选择,缺乏灵活性,且需要无法泛化的预定义规则,如图1(a)所示。其他方法 [shen2025dast, li2025selfbudgeter, chen2025overthinker, huang2025adactrl] 明确标注问题难度,但这引入了主观判断,产生了高昂的标注成本,并最终教会模型遵循外部标签,而非培养真正的自适应能力,如图1(b)所示。
为了深入分析自适应思维行为,我们重新审视预测令牌的概率分布,其中 MLLM 基于先前生成的令牌估计下一个令牌的条件概率。直观上,模式之间的转换由输出中的特殊令牌控制。如果模型自信地将一个问题识别为简单问题,它会分配更高的概率给代表非思维模式的令牌。相反,对于复杂查询,启动实质性推理的令牌应具有更高的概率。熵,量化了概率分布的不确定性,自然成为模型在模式选择上的置信度指标。这一见解启发我们将自适应思维形式化为一个熵调控的课程学习:从具有不确定模式决策的高熵状态(探索)过渡到具有自信决策的低熵状态(收敛)。在训练早期,模式切换令牌处的高熵确保了对思维和直接回答模式的平衡探索。在训练后期,低熵确保了与问题复杂性相符的一致且自信的模式选择。
为实现此目标,我们提出了 AdaThinking-E,这是一个通过在关键决策令牌处进行针对性熵调节来学习自适应思维的强化学习框架,如图1(c)所示。其核心创新在于独立奖励模式切换位置的熵动态:我们在探索阶段为高熵输出分配更高的优势,在收敛阶段为低熵输出分配更高的优势,从而实现从不确定性到一致性的原则性过渡。该机制鼓励内在地自我发现何时需要思考,而非依赖外部注入的模式标识符。与现有自适应思维策略不同,我们不依赖手工定义的查询是否需要内部思维过程,而是通过调节熵来鼓励模型自主探索何时思考。
此外,我们的解耦优化方案确保响应的实际内容完全专注于准确性,与是否实现了最优模式选择无关。虽然基于熵的框架提供了自适应思维的机制,但有效的训练需要一个能够捕捉文档理解中问题复杂性全谱的数据集——从简单的提取查询到复杂的推理任务。为弥补这一差距,我们构建了 AdaThinking-E,这是一个专为训练模型发展复杂性感知推理能力而设计的、面向文档的自适应思维数据集。
总而言之,我们的贡献有三点:
- • 我们提出了 AdaThinking-E,一个通过熵调控课程学习来学习自适应推理的新型 RL 框架。与先前需要手动模式选择或难度标签的工作不同,我们的方法通过在决策点处的熵奖励,使模型能够内在地发现何时需要思考。
- • 我们引入了 AdaThinking-E,这是第一个专为自适应思维设计的文档理解数据集。
- • 大量实验表明,AdaThinking-E 在多个基准测试上实现了最先进的性能,同时以显著更低的令牌消耗达到了思维模型的有效性。
## 2 相关工作
### 2.1 用于文档理解的 MLLMs
MLLMs 在视觉文档理解(VDU)方面展现出巨大潜力。根据多模态特征提取方式,这些方法大致可分为依赖 OCR 的 MLLMs [wang2024docllm, luo2024layoutllm, lu2025bounding, lee2024moai, kim2023visually, tanaka2024instructdoc, liao2025doclayllm, guan2024bridging, guan2023self_, guan2025posformer, guan2023self, guan2022industrial, guan2025ccdplus] 和无 OCR 的 MLLMs [chen2024internvl, zhu2023minigpt, huang2024mini, li2024monkey, hu2025mplug, ye2023ureader, feng2024docpedia, zhang2024token, yu2024texthawk2, shao2024visual, liu2024hrvda, guan2025token, duan2025docopilot, xiao2025adaptive, wang2025marten, guan2026codepercept]。依赖 OCR 的 MLLMs 利用现有 OCR 模型提取文本和布局信息。相反,无 OCR 的 MLLMs 通过直接处理文档图像实现端到端的 VDU。为了增强感知和推理能力,研究人员探索了微调 [li2024monkey, ye2023ureader, hu2025mplug, feng2024docpedia, liu2024hrvda, huang2024mini, shao2024visual, guan2025token, wang2025marten, guo2026vitexqamultiframetemporalperception, jiang2025thinkneedlargehybridreasoning] 和强化学习方法 [yu2025docthinker]。虽然先前的工作 [aggarwal2025l1, luo2025o1, ma2025cot, aytes2025sketch, xu2025chain] 通过压缩推理模型的输出长度来提高推理效率,但这些方法依赖于静态策略,限制了其在不同问题难度级别上的泛化能力。这凸显了需要一个能够采用动态推理策略的自适应思维框架。
### 2.2 具有自适应思维的 MLLMs
推理型 LLMs [jaech2024openai, wei2022chain] 通常在给出最终答案之前生成包含中间步骤的思维链(CoT),这对于涉及复杂计算和逻辑推理的任务提供了明显的好处。然而,过长的 CoT 会显著增加推理成本并降低用户体验 [chen2024not, cuadron2025danger]。最近的研究 [zeng2025done, sui2025stop, zhao2025trade, jin2025recut, wu2025more, ghosal2025does] 探讨了生成长度如何影响模型性能,揭示了不同任务的最优推理长度是不同的。因此,推理模型应根据任务难度调整其推理深度。这些方法大致可分为两类:外部控制推理模型 [xu2025chain, bercovich2025llama, chen2024not, coreteam2025mimovltechnicalreport] 和自适应思维模型 [aggarwal2025l1, luo2025o1, lou2025adacot, shen2025dast, li2025selfbudgeter, chen2025overthinker, huang2025adactrl, cheng2025incentivizing, xiang2025just, zhang2505adaptthink, kwaikeyeteam2025kwaikeyevltechnicalreport, yang2025r, tu2025learning]。外部控制推理模型使用外部机制(如提示设计)在简短回答和长链推理之间切换。Llama-Nemotron [bercovich2025llama] 采用固定的提示格式,如“reasoning on/off”来切换响应模式。相反,自适应思维模型根据问题自主选择合适的响应模式,不依赖于手工制作的提示模板。一些方法 [shen2025dast, li2025selfbudgeter, chen2025overthinker, huang2025adactrl] 使用另一个模型明确估计问题难度或令牌预算,而另一些方法 [cheng2025incentivizing, xiang2025just] 使用解题率或观察到的生成长度作为难度的隐式指标。最近的工作进一步研究了能够在思维/非思维模式之间切换的模型,其中大多数 [zhang2505adaptthink, kwaikeyeteam2025kwaikeyevltechnicalreport, yang2025r] 采用了显式训练模型选择推理模式的策略。在冷启动阶段,双模退火机制使模型同时具备推理和非推理能力,而在 RL 阶段,精心设计的奖励函数指导是否参与推理的决策。受训练者主观意图的严重影响,此类方法未能反映自适应思维模型对模式选择的真实理解和自主探索。然而,现有方法未能检验模式切换的核心机制:输出模式切换令牌时的概率分布。我们的方法将模型切换令牌的熵引入奖励函数。通过引导熵的变化,它指导思维/非思维模式的切换。
## 3 方法论
参见图例图2:AdaThinking-E 概览,一种通过熵调节进行自适应思维的强化学习方法。该框架包含两个阶段:(1) 冷启动:模型使用 AdaThinking-E 进行微调,以生成思维和非思维模式的输出;(2) RL:模型使用冷启动权重作为初始化,分别优化两种令牌类型。模式切换令牌从高熵探索过渡到低熵决策,控制模式间的采样比例。响应令牌(剩余令牌)优化答案质量。在右下角,模式切换令牌使用熵奖励,而响应令牌使用专注于内容的质量奖励。
在本节中,我们介绍 AdaThinking-E,一种用于细化模型行为的熵调节方法,如图2所示。所提出的方法包含两个不同的训练阶段:(1) 冷启动阶段,MLLM 被微调以支持简洁和详细的响应模式;(2) 强化学习阶段,为不同类型的令牌设计不同的优化目标。具体而言,模式切换令牌通过控制其熵的变化来调节不同模式间的采样比例,从而在此过程中学习何时思考。同时,响应令牌(即剩余令牌)无论模式切换令牌选择何种模式,都努力尽可能生成正确的答案。
### 3.1 用于冷启动的 AdaThinking-E
为确保我们提出的模型在冷启动阶段能稳定输出思维和非思维两种模式,我们构建了 AdaThinking-E 数据集(源自现有的公开数据集),包含这两种模式的数据。对于思维模式的数据,我们选择 Seed1.5-VL [guo2025seed15vltechnicalreport] 来生成详细的推理过程,然后通过 GPT-4o-mini [openai2024gpt4ocard] 验证其逻辑严密性。
关于数据格式的设计,我们将模式切换令牌定义为 /no\_think 或 /to\_think,分别代表非思维和思维模式。同时,响应令牌遵循广泛采用的格式:空内容或思考内容。此外,我们认识到,手动指定哪些问题需要思考,或使用模型蒸馏来做出此决定,会给被训练的模型施加外部假设。这种预定的偏见会阻碍而非帮助模型在强化学习(RL)阶段发展出真正的洞察力。相似文章
AEM:用于多轮智能体强化学习的自适应熵调制
本文介绍了AEM,这是一种用于智能体强化学习的无监督方法,通过在响应级别自适应调整熵动态来改善探索与利用之间的平衡。通过在ALFWorld和SWE-bench等基准测试上展示性能提升,该方法将不确定性估计与动作粒度对齐。
驾驭思考者:用于自适应LLM推理的条件熵塑造
本文介绍了条件熵塑造(CES)框架,该框架动态控制LLM中令牌级别的响应熵,以平衡推理深度和简洁性,在数学基准测试上实现更高的准确率同时缩短响应长度。
STARE:惊奇度引导的令牌级优势重加权实现策略熵稳定性
STARE 通过引入惊奇度引导的令牌级优势重加权和目标熵调节,解决了基于GRPO的大语言模型强化学习中的策略熵崩溃问题,在AIME基准上实现了4%-8%的准确率提升。
选择性优势熵自适应范围GRPO:用于语言模型高效强化学习的非对称令牌级折扣
本文介绍了GRPO的自适应范围和选择性优势变体,这些变体使用基于熵的令牌级折扣来稳定训练并提高数学推理任务的性能,以更低的方差实现了更强的结果。
重新审视熵正则化:自适应系数释放其在LLM强化学习中的潜力
本文提出自适应熵正则化(AER)框架,通过难度感知的系数分配和初始锚定目标熵来动态平衡LLM强化学习中的探索与利用,解决策略熵坍缩问题。在数学推理基准上的实验验证了该方法在准确性和探索能力上的一致性改进。