标签
介绍了AuroOFT,一种通过零起点门控低秩非线性残差增强量化正交微调(QOFT)的方法,在低比特语言模型上以更少的可训练参数提升了数学推理准确率,优于QOFT和QLoRA。
Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.
本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。
该论文提出 LSPO(LoRA Scaffolded Policy Optimization),用于解决 GRPO 在零奖励“悬崖题”上梯度消失的问题:通过临时 LoRA 适配器进行短暂 SFT 并采样成功轨迹,经重要性采样校正后回灌 RL batch,最终只更新基础模型。实验表明在 DeepMath-103K 上优于 DAPO 基线,平均提升 3.8 点。
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
本文研究多智能体数学推理系统,发现审稿人在识别错误方面的精确性并不能保证解题者会采纳这些批评意见,揭示了检测与有效采纳之间的差距,从而限制了整体性能的提升。
CADENCE 引入了一个统一框架,解决了在线策略知识蒸馏用于推理时的冷启动崩溃、状态无关调度和奖励稀疏性问题,在单个Mac Studio上使用紧凑学生模型在GSM8K和MATH-500上取得了强劲结果。
AIMO Interpretability Challenge 是一项旨在利用可解释性方法区分前沿数学语言模型中的稳健推理与虚假推理的竞赛,提供新问题、模型访问权限和计算基础设施。
提出了一种智能体框架,利用通用编码大语言模型将研究级数学自动形式化为Lean 4代码,并在Putnam问题和STOC会议论文上进行了评估。
HuiHui 是一种经过消融处理的模型变体,在数学和代码任务上出人意料地超越了基础模型 3.6-35B-a3b。
本文引入了LLM数学推理中的策略多样性概念,表明表面多样性指标是不可靠的替代指标,而直接优化策略多样性仍是一个开放问题。
微博AI发布了VibeThinker-3B,一个拥有30亿参数的开源推理模型,采用MIT许可证,在数学、编程和STEM推理基准测试上取得了有竞争力的结果。
SuperThoughts 将连续的思维链令牌压缩为潜在表示,并每步解码两个令牌,在数学推理基准上实现了约20-30%的思维链长度缩减,准确率损失极小,同时将推理吞吐量提高了一倍。
ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。
Epoch AI 发布了 FrontierMath 基准测试的 v2 更新,纠正了 42% 问题中的错误,并提高了所有模型的分数,但排名基本保持不变;第 1-4 级正在接近饱和。
本文介绍了一个数学论坛平台,该平台将图像到LaTeX的转换流程直接集成到发帖界面中,减少了用户的操作障碍。系统旨在生成一个经过社区验证的数学问题与解答数据集,用于训练AI推理系统。
本文介绍 SWARR,一种两阶段方案,结合监督微调和强化学习,使滑动窗口注意力模型适应数学推理,表明强化学习能缩小其与自注意力的性能差距,同时保持效率优势。
该论文推出KCSAT-ML基准,包含十年韩国高考数学题及全国考生错误率,并提出难度对齐推理增益(DRG)指标,揭示模型错误与人类难度的对齐模式,展现相同准确率下截然不同的推理行为。
这条推文线程介绍了一项研究:训练模型验证自身工作,可使模型在复杂数学问题上的准确率几乎翻倍,并将科学推理能力提升14倍。
微软AI推出MAI-Thinking-1,这是一个350亿活跃参数的推理模型,从头训练,无需蒸馏,在软件工程和数学基准测试中表现强劲,同时强调干净数据和自给自足。