标签
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。
本文提出Hyper-ES,一种基于子空间的进化策略框架,用于LLM推理。该框架通过轻量级基于梯度的微调获得下降方向,然后使用CMA-ES合并逐层的DARE-TIES系数,在需要更少梯度更新的情况下持续优于GRPO-LoRA。
介绍了AMTFV,一个通过数学工具流接口将数学验证建模与执行解耦的智能体框架,在五个具有挑战性的数学数据集上改进了LLM的答案验证与修订。
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.
本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。
提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
本文通过系统性地变化等价问题的表面表示,研究了大语言模型在数学问题求解中的表示鲁棒性,发现存在显著的敏感性,并表明代码增强推理并不能统一消除脆弱性。
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
继OpenAI的CDC证明发布后,据报道GPT-5.6使用类似提示词解决了凸优化领域一个30年未解问题,并在Lean证明助手中验证了该解。
GPT-5.6又解决了一个由数学家Paul Erdős提出的50多年未解决的难题,展示了人工智能在数学推理能力上的重大飞跃。
AdvancedMathBench是一个新的基准套件,用于评估大语言模型在高级数学证明生成与验证方面的性能。它包含用于生成的ProverBench和用于验证的VerifierBench,表明当前模型如GPT-5.5-xhigh仅取得了有限的性能。
GPT-5.6 在一个关于梯度流长度的基础数学问题上显著超越了已发布的最先进水平,实现了指数级的改进。这标志着人工智能在推理复杂数学问题能力上的重大进步。
这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。
介绍MIRA-Math,这是一个基准测试,能够隔离并评估模型识别缺失原子事实、用自然语言精确请求这些事实,并将返回的信息整合到正确最终答案中的能力。该基准测试采用确定性实例生成和固定的受限响应器。
本文提出了一种ReAct风格的智能体设置,将LLM推理与SageMath的可验证反馈相结合,并在研究级数学问题上进行了评估。结果显示,各模型性能显著提升,其中GPT-5.5取得了最高的75.2%解题率。
PluraMath 将 PolyMath 数据集扩展到 18 种未被充分代表的语言,提供了一个经过人工验证的基准,用于评估 LLM 中的多语言数学推理。该论文揭示了在 27 个模型中,高资源和低资源语言之间持续存在的性能差距。
Danus 是一个面向研究级数学推理的编排系统,它利用共享的事实图谱作为全局记忆,管理多个 LLM 智能体的并行证明搜索,并配备无状态验证器用于增量式证明构建。
本文系统比较了小语言模型在数学推理中用于可验证奖励强化学习(RLVR)的过程奖励与结果奖励结构。研究发现,仅过程监督相比仅结果监督显著提高了准确性和推理轨迹保真度,并分析了失败模式。