math-reasoning

标签

Cards List
#math-reasoning

LLMs中的数学推理按方法组织,而非主题

arXiv cs.AI · 6小时前 缓存

本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。

0 人收藏 0 人点赞
#math-reasoning

@kyutai_labs: 我们正在发布 Voice of Reason,一个原生语音模型,可以口头进行数学计算。给它一个语音问题,无需转录……

X AI KOLs Timeline · 2天前 缓存

Kyutai Labs 发布了 Voice of Reason,一个原生语音模型,无需转录或文本大语言模型,即可解决语音数学问题,在 GSM8K 上达到 77.1%,相比 GLM-4-Voice 的 27.3% 有所提升。

0 人收藏 0 人点赞
#math-reasoning

低方差奖励下群组相对优化中的优势尺度校准不平衡:诊断与有界恢复

arXiv cs.CL · 6天前 缓存

本文针对低方差奖励下群组相对优化中的优势尺度校准问题,提出了如Reward-Resolution Protocol和MaxNorm-AC等方法,以过滤亚分辨率抖动并为可信差距提供有界恢复。

0 人收藏 0 人点赞
#math-reasoning

LLM数学推理中应用题求解的四阶段分解与机制脆弱性

arXiv cs.AI · 2026-09-17 缓存

本文提出了一种四阶段的机制分解,描述大型语言模型如何解答数学应用题,并通过特定的注意力头将脆弱性从无关子句定位到操作规划阶段。

0 人收藏 0 人点赞
#math-reasoning

通过对100个斑马谜题进行微调,Qwen 3 4B Base在MATH-500基准测试中提升了31%。包含一个6.5分钟的复现笔记本(使用单个H100/H200)。

Reddit r/LocalLLaMA · 2026-09-11 缓存

在源自斑马谜题的逻辑谜题上微调小型AI模型,能在MATH-500等数学基准测试中取得显著改进,并提供开源资源和笔记本用于复现。

0 人收藏 0 人点赞
#math-reasoning

ZGCM-1:一个完全开放且极其高效的数学与代理搜索基础模型

Hugging Face Daily Papers · 2026-09-11 缓存

ZGCM-1是一个从头训练的7B开放基础模型,具有极高效率,结合内部推理和外部工具使用,用于数学和代理搜索任务,其性能与更大规模的模型如Qwen3-235B-A22B和GLM-5.1相当。

0 人收藏 0 人点赞
#math-reasoning

@HuggingPapers: FlowBalance: 基于验证器的推理模型自改进技术 在GRPO上平均提升数学推理能力 +2.12 …

X AI KOLs Following · 2026-09-08 缓存

FlowBalance 介绍了一种基于验证器的自改进技术,该技术在 Qwen3-8B 模型上相比 GRPO 平均提升了数学推理性能 2.12 分,提供了更快的训练速度、更强的稳定性和更高的解决方案多样性。

0 人收藏 0 人点赞
#math-reasoning

提示、评论家与教师:视觉-语言数学推理中稀疏奖励强化学习的先验注入

arXiv cs.AI · 2026-08-25 缓存

本文比较了视觉-语言数学推理中稀疏奖励强化学习的先验注入方法,发现其有效性取决于传递方式,并且某些评估切片可能会误导泛化评估。

0 人收藏 0 人点赞
#math-reasoning

SimpleOPD:面向长上下文推理的简单分词器无关在策略蒸馏方法

arXiv cs.CL · 2026-08-17 缓存

本文提出SimpleOPD方法,实现了从长上下文推理教师模型到短上下文学生模型的在职蒸馏。该方法通过解决分词器不匹配与训练不稳定问题,有效提升了数学推理能力。

0 人收藏 0 人点赞
#math-reasoning

强化步骤级推理以实现LLM中的有效自我纠正

arXiv cs.CL · 2026-08-13 缓存

本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。

0 人收藏 0 人点赞
#math-reasoning

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers · 2026-08-09 缓存

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

0 人收藏 0 人点赞
#math-reasoning

超越旋转:AuroOFT用于表达性量化正交微调

arXiv cs.LG · 2026-08-07 缓存

介绍了AuroOFT,一种通过零起点门控低秩非线性残差增强量化正交微调(QOFT)的方法,在低比特语言模型上以更少的可训练参数提升了数学推理准确率,优于QOFT和QLoRA。

0 人收藏 0 人点赞
#math-reasoning

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

arXiv cs.AI · 2026-08-07 缓存

Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.

0 人收藏 0 人点赞
#math-reasoning

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers · 2026-08-06 缓存

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

0 人收藏 0 人点赞
#math-reasoning

@vintcessun: 最难的题,反而最教不会模型?GRPO 的死区就在这里:一组 rollout 全错,组内优势归零,梯度也随之消失。 https://arxiv.org/abs/2607.27787 LSPO 给这些“悬崖题”临时装上 LoRA:用标准推导短…

X AI KOLs Timeline · 2026-08-03 缓存

该论文提出 LSPO(LoRA Scaffolded Policy Optimization),用于解决 GRPO 在零奖励“悬崖题”上梯度消失的问题:通过临时 LoRA 适配器进行短暂 SFT 并采样成功轨迹,经重要性采样校正后回灌 RL batch,最终只更新基础模型。实验表明在 DeepMath-103K 上优于 DAPO 基线,平均提升 3.8 点。

0 人收藏 0 人点赞
#math-reasoning

Weak-to-Strong On-Policy Distillation

arXiv cs.LG · 2026-07-30 缓存

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

0 人收藏 0 人点赞
#math-reasoning

精确但不耦合:审稿人的精确性并不能保证在多智能体数学推理中采纳批评意见

arXiv cs.AI · 2026-07-20 缓存

本文研究多智能体数学推理系统,发现审稿人在识别错误方面的精确性并不能保证解题者会采纳这些批评意见,揭示了检测与有效采纳之间的差距,从而限制了整体性能的提升。

0 人收藏 0 人点赞
#math-reasoning

CADENCE: 通过覆盖自适应在线策略蒸馏缩小推理差距

Hugging Face Daily Papers · 2026-07-18 缓存

CADENCE 引入了一个统一框架,解决了在线策略知识蒸馏用于推理时的冷启动崩溃、状态无关调度和奖励稀疏性问题,在单个Mac Studio上使用紧凑学生模型在GSM8K和MATH-500上取得了强劲结果。

0 人收藏 0 人点赞
#math-reasoning

AIMO Interpretability Challenge

arXiv cs.AI · 2026-07-16 缓存

AIMO Interpretability Challenge 是一项旨在利用可解释性方法区分前沿数学语言模型中的稳健推理与虚假推理的竞赛,提供新问题、模型访问权限和计算基础设施。

0 人收藏 0 人点赞
#math-reasoning

超越图书馆:一种用于自动形式化研究数学的智能体框架

arXiv cs.AI · 2026-07-01 缓存

提出了一种智能体框架,利用通用编码大语言模型将研究级数学自动形式化为Lean 4代码,并在Putnam问题和STOC会议论文上进行了评估。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈