向思维模型教授工具推理:工具集成推理的全流程方案

arXiv cs.CL 论文

摘要

本文提出了一种全流程方案,用于向思维模型教授工具推理,该方法应用于 Qwen3 模型时,在 AIME 2025 等基准测试上实现了最先进的性能。

arXiv:2605.06326v1 发布类型:新论文 摘要:工具集成推理(TIR)提供了一种直接的方式,使思维模型能够突破纯文本推理的局限。然而,我们观察到一个悖论现象:即使在强大的思维模型几乎不进行实际工具调用的情况下,启用工具的评估仍会降低推理性能。在本文中,我们研究了如何在不牺牲其纯文本推理能力的前提下,将自然的工具使用行为注入到强大的思维模型中,并提出了一套全面的 TIR 方案。我们强调:(i) TIR 监督微调(SFT)的有效性取决于教师轨迹的可学习性,应优先选择本质上适合通过工具增强解决的问题;(ii) 控制工具使用轨迹的比例可以缓解纯文本推理能力的灾难性遗忘;(iii) 优化 pass@k 和响应长度而非训练损失,可以在最大化 TIR SFT 增益的同时,为强化学习(RL)探索保留空间;(iv) 基于合适的 SFT 初始化并明确防止模式崩溃的、具有可验证奖励的稳定强化学习(RLVR)阶段,提供了一种简单但效果显著解决方案。当应用于 4B 和 30B 规模的 Qwen3 思维模型时,我们的方案生成的模型在多种开源模型基准测试中达到了最先进的性能,例如在 AIME 2025 上,4B 和 30B 模型分别取得了 96.7% 和 99.2% 的成绩。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:45

# 教授思维模型使用工具进行推理:工具集成推理的全流程方案
来源:https://arxiv.org/abs/2605.06326
作者:Qianjia Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+Q)、Yuchen Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Y)、Zhilin Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Z)、Yuxin Zuo (https://arxiv.org/search/cs?searchtype=author&query=Zuo,+Y)、Shunkai Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+S)、Yuchen Fan (https://arxiv.org/search/cs?searchtype=author&query=Fan,+Y)、Yu Qiao (https://arxiv.org/search/cs?searchtype=author&query=Qiao,+Y)、Bowen Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+B)、Ning Ding (https://arxiv.org/search/cs?searchtype=author&query=Ding,+N)、Yu Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+Y)、Yun Luo (https://arxiv.org/search/cs?searchtype=author&query=Luo,+Y)、Ganqu Cui (https://arxiv.org/search/cs?searchtype=author&query=Cui,+G)

查看 PDF (https://arxiv.org/pdf/2605.06326)

> 摘要:工具集成推理(Tool-Integrated Reasoning, TIR)提供了一种直接扩展思维模型,使其超越纯文本推理限制的方法。然而,我们观察到一个矛盾现象:即使强大的思维模型几乎不进行任何实际的工具调用,启用工具的评估反而会导致推理性能下降。在本文中,我们研究了如何在不牺牲其无工具推理能力的前提下,将自然的工具使用行为注入到强大的思维模型中,并提出了一套全面的 TIR 方案。我们强调:(i) TIR 监督微调(SFT)的有效性取决于教师轨迹的可学习性,应优先选择天生适合通过工具增强来解决的问题;(ii) 控制工具使用轨迹的比例可以缓解对纯文本推理能力的灾难性遗忘;(iii) 优化 pass@k 指标和响应长度,而非训练损失,可以在最大化 TIR SFT 收益的同时,为强化学习(RL)探索保留余地;(iv) 基于合适的 SFT 初始化并明确防范模式崩溃的稳定可验证奖励强化学习(RLVR)阶段,提供了一种简单但极其有效的解决方案。将该方案应用于 4B 和 30B 规模的 Qwen3 思维模型后,所得模型在多种基准测试中取得了开源模型中的最先进(SOTA)性能,例如在 AIME 2025 上,4B 和 30B 模型分别达到了 96.7% 和 99.2%。

## 提交历史

来自:Qianjia Cheng \[查看邮件 (https://arxiv.org/show-email/3461b66e/2605.06326)\] **\[v1\]** 2026年5月7日 星期四 14:23:21 UTC (975 KB)

相似文章

OmniThoughtVis:一种用于部署型多模态推理模型的可扩展蒸馏流水线

arXiv cs.CL

本文介绍了 OmniThoughtVis,这是一种可扩展的流水线,用于将多模态推理能力从大型教师模型蒸馏到更小、面向部署的多模态大语言模型(MLLMs)中。该方法利用精心策划的思维链(chain-of-thought)数据,显著提升了从2B到8B参数规模模型在 MathVerse 和 MMMU-Pro 等基准测试上的推理性能。

让语言模型学会用代码思考

arXiv cs.CL

本文介绍了 ThinC(Thinking in Code,用代码思考)框架。在该框架中,语言模型在简短的自然语言规划步骤后,仅使用代码块进行推理,在数学基准测试中优于现有的工具集成推理基线。

平衡思考的高效推理

Papers with Code Trending

本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。

通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力

arXiv cs.CL

本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。