math-reasoning

标签

Cards List
#math-reasoning

超越旋转:AuroOFT用于表达性量化正交微调

arXiv cs.LG · 2天前 缓存

介绍了AuroOFT,一种通过零起点门控低秩非线性残差增强量化正交微调(QOFT)的方法,在低比特语言模型上以更少的可训练参数提升了数学推理准确率,优于QOFT和QLoRA。

0 人收藏 0 人点赞
#math-reasoning

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

arXiv cs.AI · 2天前 缓存

Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.

0 人收藏 0 人点赞
#math-reasoning

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers · 3天前 缓存

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

0 人收藏 0 人点赞
#math-reasoning

@vintcessun: 最难的题,反而最教不会模型?GRPO 的死区就在这里:一组 rollout 全错,组内优势归零,梯度也随之消失。 https://arxiv.org/abs/2607.27787 LSPO 给这些“悬崖题”临时装上 LoRA:用标准推导短…

X AI KOLs Timeline · 6天前 缓存

该论文提出 LSPO(LoRA Scaffolded Policy Optimization),用于解决 GRPO 在零奖励“悬崖题”上梯度消失的问题:通过临时 LoRA 适配器进行短暂 SFT 并采样成功轨迹,经重要性采样校正后回灌 RL batch,最终只更新基础模型。实验表明在 DeepMath-103K 上优于 DAPO 基线,平均提升 3.8 点。

0 人收藏 0 人点赞
#math-reasoning

Weak-to-Strong On-Policy Distillation

arXiv cs.LG · 2026-07-30 缓存

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

0 人收藏 0 人点赞
#math-reasoning

精确但不耦合:审稿人的精确性并不能保证在多智能体数学推理中采纳批评意见

arXiv cs.AI · 2026-07-20 缓存

本文研究多智能体数学推理系统,发现审稿人在识别错误方面的精确性并不能保证解题者会采纳这些批评意见,揭示了检测与有效采纳之间的差距,从而限制了整体性能的提升。

0 人收藏 0 人点赞
#math-reasoning

CADENCE: 通过覆盖自适应在线策略蒸馏缩小推理差距

Hugging Face Daily Papers · 2026-07-18 缓存

CADENCE 引入了一个统一框架,解决了在线策略知识蒸馏用于推理时的冷启动崩溃、状态无关调度和奖励稀疏性问题,在单个Mac Studio上使用紧凑学生模型在GSM8K和MATH-500上取得了强劲结果。

0 人收藏 0 人点赞
#math-reasoning

AIMO Interpretability Challenge

arXiv cs.AI · 2026-07-16 缓存

AIMO Interpretability Challenge 是一项旨在利用可解释性方法区分前沿数学语言模型中的稳健推理与虚假推理的竞赛,提供新问题、模型访问权限和计算基础设施。

0 人收藏 0 人点赞
#math-reasoning

超越图书馆:一种用于自动形式化研究数学的智能体框架

arXiv cs.AI · 2026-07-01 缓存

提出了一种智能体框架,利用通用编码大语言模型将研究级数学自动形式化为Lean 4代码,并在Putnam问题和STOC会议论文上进行了评估。

0 人收藏 0 人点赞
#math-reasoning

有点意外:HuiHui abliterated 在数学和代码上优于 vanilla 3.6-35B-a3b。

Reddit r/LocalLLaMA · 2026-06-29

HuiHui 是一种经过消融处理的模型变体,在数学和代码任务上出人意料地超越了基础模型 3.6-35B-a3b。

0 人收藏 0 人点赞
#math-reasoning

我们测量的是策略还是措辞?LLM数学推理中表面多样性与策略多样性之间的差距

Hugging Face Daily Papers · 2026-06-29 缓存

本文引入了LLM数学推理中的策略多样性概念,表明表面多样性指标是不可靠的替代指标,而直接优化策略多样性仍是一个开放问题。

0 人收藏 0 人点赞
#math-reasoning

@TeksEdge:激动人心的消息!VibeThinkiner-3B来了!好的,localmaxxers准备好测试吧!!为什么?因为3B模型的推理宣称达到了SOTA级别…

X AI KOLs Following · 2026-06-17 缓存

微博AI发布了VibeThinker-3B,一个拥有30亿参数的开源推理模型,采用MIT许可证,在数学、编程和STEM推理基准测试上取得了有竞争力的结果。

0 人收藏 0 人点赞
#math-reasoning

SuperThoughts:叠加态中的推理令牌

arXiv cs.LG · 2026-06-15 缓存

SuperThoughts 将连续的思维链令牌压缩为潜在表示,并每步解码两个令牌,在数学推理基准上实现了约20-30%的思维链长度缩减,准确率损失极小,同时将推理吞吐量提高了一倍。

0 人收藏 0 人点赞
#math-reasoning

ExpRL:面向LLM中期训练的探索式强化学习

Hugging Face Daily Papers · 2026-06-15 缓存

ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。

0 人收藏 0 人点赞
#math-reasoning

Claude Fable 5 的 FrontierMath 分数

Reddit r/singularity · 2026-06-12

Epoch AI 发布了 FrontierMath 基准测试的 v2 更新,纠正了 42% 问题中的错误,并提高了所有模型的分数,但排名基本保持不变;第 1-4 级正在接近饱和。

0 人收藏 0 人点赞
#math-reasoning

面向协作问题求解与AI推理数据集生成的数学论坛平台

arXiv cs.AI · 2026-06-12 缓存

本文介绍了一个数学论坛平台,该平台将图像到LaTeX的转换流程直接集成到发帖界面中,减少了用户的操作障碍。系统旨在生成一个经过社区验证的数学问题与解答数据集,用于训练AI推理系统。

0 人收藏 0 人点赞
#math-reasoning

架构感知的强化学习使滑动窗口注意力在数学推理中具有竞争力

arXiv cs.AI · 2026-06-11 缓存

本文介绍 SWARR,一种两阶段方案,结合监督微调和强化学习,使滑动窗口注意力模型适应数学推理,表明强化学习能缩小其与自注意力的性能差距,同时保持效率优势。

0 人收藏 0 人点赞
#math-reasoning

KCSAT-ML: 利用全国队列人类难度探究推理模型

arXiv cs.CL · 2026-06-10 缓存

该论文推出KCSAT-ML基准,包含十年韩国高考数学题及全国考生错误率,并提出难度对齐推理增益(DRG)指标,揭示模型错误与人类难度的对齐模式,展现相同准确率下截然不同的推理行为。

0 人收藏 0 人点赞
#math-reasoning

@ChenHenryWu: 自我提升取决于模型能否判断自身工作。我们通常训练模型生成更好的内容——为什么不也训练它们进行同等水平的验证?

X AI KOLs Timeline · 2026-06-05 缓存

这条推文线程介绍了一项研究:训练模型验证自身工作,可使模型在复杂数学问题上的准确率几乎翻倍,并将科学推理能力提升14倍。

0 人收藏 0 人点赞
#math-reasoning

MAI-Thinking-1

Hacker News Top · 2026-06-02 缓存

微软AI推出MAI-Thinking-1,这是一个350亿活跃参数的推理模型,从头训练,无需蒸馏,在软件工程和数学基准测试中表现强劲,同时强调干净数据和自给自足。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈