标签
本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。
Kyutai Labs 发布了 Voice of Reason,一个原生语音模型,无需转录或文本大语言模型,即可解决语音数学问题,在 GSM8K 上达到 77.1%,相比 GLM-4-Voice 的 27.3% 有所提升。
本文针对低方差奖励下群组相对优化中的优势尺度校准问题,提出了如Reward-Resolution Protocol和MaxNorm-AC等方法,以过滤亚分辨率抖动并为可信差距提供有界恢复。
本文提出了一种四阶段的机制分解,描述大型语言模型如何解答数学应用题,并通过特定的注意力头将脆弱性从无关子句定位到操作规划阶段。
在源自斑马谜题的逻辑谜题上微调小型AI模型,能在MATH-500等数学基准测试中取得显著改进,并提供开源资源和笔记本用于复现。
ZGCM-1是一个从头训练的7B开放基础模型,具有极高效率,结合内部推理和外部工具使用,用于数学和代理搜索任务,其性能与更大规模的模型如Qwen3-235B-A22B和GLM-5.1相当。
FlowBalance 介绍了一种基于验证器的自改进技术,该技术在 Qwen3-8B 模型上相比 GRPO 平均提升了数学推理性能 2.12 分,提供了更快的训练速度、更强的稳定性和更高的解决方案多样性。
本文比较了视觉-语言数学推理中稀疏奖励强化学习的先验注入方法,发现其有效性取决于传递方式,并且某些评估切片可能会误导泛化评估。
本文提出SimpleOPD方法,实现了从长上下文推理教师模型到短上下文学生模型的在职蒸馏。该方法通过解决分词器不匹配与训练不稳定问题,有效提升了数学推理能力。
本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
介绍了AuroOFT,一种通过零起点门控低秩非线性残差增强量化正交微调(QOFT)的方法,在低比特语言模型上以更少的可训练参数提升了数学推理准确率,优于QOFT和QLoRA。
Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.
本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。
该论文提出 LSPO(LoRA Scaffolded Policy Optimization),用于解决 GRPO 在零奖励“悬崖题”上梯度消失的问题:通过临时 LoRA 适配器进行短暂 SFT 并采样成功轨迹,经重要性采样校正后回灌 RL batch,最终只更新基础模型。实验表明在 DeepMath-103K 上优于 DAPO 基线,平均提升 3.8 点。
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
本文研究多智能体数学推理系统,发现审稿人在识别错误方面的精确性并不能保证解题者会采纳这些批评意见,揭示了检测与有效采纳之间的差距,从而限制了整体性能的提升。
CADENCE 引入了一个统一框架,解决了在线策略知识蒸馏用于推理时的冷启动崩溃、状态无关调度和奖励稀疏性问题,在单个Mac Studio上使用紧凑学生模型在GSM8K和MATH-500上取得了强劲结果。
AIMO Interpretability Challenge 是一项旨在利用可解释性方法区分前沿数学语言模型中的稳健推理与虚假推理的竞赛,提供新问题、模型访问权限和计算基础设施。
提出了一种智能体框架,利用通用编码大语言模型将研究级数学自动形式化为Lean 4代码,并在Putnam问题和STOC会议论文上进行了评估。