真正提升数学推理的是什么:超越纯代码的结构化推理信号
摘要
本文挑战了代码能提升语言模型推理能力的观点,通过受控的预训练实验发现,代码主要提升编程能力,而推理能力的提升来自结构化推理轨迹(如代码-文本混合和数学-文本混合)。
arXiv:2605.19762v1 Announce Type: new
摘要:代码已成为现代基础语言模型(LM)训练的标准组成部分,但其在编程之外的作用仍不明确。我们通过在一个10T词元的细粒度领域分离语料库上进行受控预训练实验,重新审视了代码提升推理能力的说法。我们的发现有三点。第一,当代码被限制为独立可执行程序,并控制代码-自然语言(Code-NL)数据时,代码主要提升编程能力,但并非通用的推理增强器;相反,它会与知识密集型任务(尤其是复杂数学推理)产生竞争。第二,通常归因于代码的推理提升,实际上更应归因于跨领域的结构化推理轨迹(如代码-文本和数学-文本混合),而非单纯的可执行代码。第三,在固定数学预算内增加结构化数学样本的密度,能在大幅提升困难数学推理能力的同时,较好地保持编程性能,这表明认知脚手架为缓解跨领域权衡提供了一种有针对性的方法。最后,路由分析显示,数据组成效应反映在专家激活模式中,为跨领域的竞争与协同交互提供了机制层面的证据。我们的研究结果厘清了哪些数据特征能跨能力维度迁移,并指出了更精确的数据中心优化策略。
相似文章
推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化
本文使用 Claude Haiku 4.5 在 1000 个 GSM-Symbolic 问题上评估了三种方法(纯思维链推理、单次代码执行和迭代代码执行),发现思维链对扰动最为鲁棒,而代码执行并未提升小学数学问题的推理鲁棒性。
大型语言模型中的数学推理:基准、架构、评估与开放挑战
本综述综合了大型语言模型在数学推理方面的最新进展,涵盖了基准、架构、训练策略和评估协议。它指出了推理忠实性和基准偏差等关键挑战。
推理模型并非只是思考更久,其运作轨迹也不同
本文通过分析代码、数学和SAT领域中的隐藏状态轨迹几何特征,探究经推理训练的语言模型是否仅仅分配更多计算资源(更长的思维链),还是遵循了性质不同的内部轨迹。在纠正生成长度的影响后,他们发现经推理训练的模型展现出独特的轨迹几何特征——在代码领域最为明显——这表明推理训练改变了计算展开的方式,而不仅仅是计算量的多少。
让语言模型学会用代码思考
本文介绍了 ThinC(Thinking in Code,用代码思考)框架。在该框架中,语言模型在简短的自然语言规划步骤后,仅使用代码块进行推理,在数学基准测试中优于现有的工具集成推理基线。
通过过程监督改进数学推理
OpenAI 展示了过程监督——对中间推理步骤而非仅对最终答案进行奖励——如何改进数学推理,同时降低对齐成本。这种方法在不牺牲模型性能的前提下,产生更易解释、更符合人类价值观的推理过程。