mathematical-reasoning

标签

Cards List
#mathematical-reasoning

信任区域策略蒸馏

Hugging Face Daily Papers · 2026-07-06 缓存

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

0 人收藏 0 人点赞
#mathematical-reasoning

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers · 2026-07-06 缓存

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

0 人收藏 0 人点赞
#mathematical-reasoning

dOPSD:扩散语言模型中的在线策略自蒸馏方法

Hugging Face Daily Papers · 2026-07-05 缓存

本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。

0 人收藏 0 人点赞
#mathematical-reasoning

@sophiamyang: 介绍 Leanstral 1.5 一个119B(6B活跃)的开放模型,用于Lean 4的形式化证明工程:在miniF2F上达到100% 587/672…

X AI KOLs Following · 2026-07-03 缓存

介绍 Leanstral 1.5,一个119B参数(6B活跃)的开放模型,用于Lean 4的形式化证明工程,在miniF2F上达到100%,在PutnamBench和FATE基准测试上达到最先进分数,并发现了开源仓库中先前未知的漏洞。

0 人收藏 0 人点赞
#mathematical-reasoning

SLIM-RL: 基于风险预算的随机掩码强化学习用于扩散语言模型,无需轨迹切分

arXiv cs.CL · 2026-07-02 缓存

SLIM-RL 提出了一种基于风险预算的随机掩码强化学习方法,用于扩散语言模型,避免了轨迹切分,在数学和代码基准测试中以显著更少的训练样本取得了最先进的结果。

0 人收藏 0 人点赞
#mathematical-reasoning

单层就够了吗?训练单个Transformer层可媲美全参数强化学习训练

Hugging Face Daily Papers · 2026-07-02 缓存

一项研究发现,Transformer中的强化学习收益集中在单个中间层,仅训练该层即可在多个模型和任务上匹配或超越全参数强化学习训练。

0 人收藏 0 人点赞
#mathematical-reasoning

ISM:用于连续数学推理的自我改进策略记忆

arXiv cs.LG · 2026-07-01 缓存

ISM引入了一个自进化记忆系统,该系统存储并优化策略模式,以在连续学习场景下提升冻结LLM的数学推理能力,在MATH-Hard和OlympiadBench基准上优于基线方法。

0 人收藏 0 人点赞
#mathematical-reasoning

从大型推理模型到紧凑型学生模型的知识蒸馏:以John O Bryan数学竞赛为例

arXiv cs.LG · 2026-07-01 缓存

本文研究了从DeepSeek-R1推理模型到紧凑型Qwen2.5-7B学生模型的知识蒸馏,使用了基于John O'Bryan数学竞赛问题构建的思维链(CoT)语料库。微调后的学生模型在竞赛数据集上取得了4.76个百分点的提升,并泛化到MATH-500,同时还分析了回答长度对推理质量的影响。

0 人收藏 0 人点赞
#mathematical-reasoning

从搜索到综合:训练大语言模型为零样本工作流生成器

arXiv cs.LG · 2026-07-01 缓存

介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。

0 人收藏 0 人点赞
#mathematical-reasoning

PHF:策略自适应自蒸馏中的特权隐式流

arXiv cs.AI · 2026-06-30 缓存

PHF提出了一种方法,在策略自适应自蒸馏过程中,将特权教师模型的隐藏状态轨迹蒸馏给学生模型,从而提升语言模型的推理性能。

0 人收藏 0 人点赞
#mathematical-reasoning

过程优势信号塑形:用于LLM推理器中过程监督强化学习的范式无关中间件

arXiv cs.AI · 2026-06-30 缓存

PASS是一种中间件,它修复了LLM推理器过程监督强化学习中的三种病理现象,通过独立标准化流、按值分块和使用平均价值密度来改进GRPO。它在数学推理和多跳问答中显示出持续的增益。

0 人收藏 0 人点赞
#mathematical-reasoning

形式化公理系统中的自监督定理发现

arXiv cs.AI · 2026-06-30 缓存

本文提出了一种自监督定理发现算法,该算法仅从公理和推理规则出发,无需人类先验知识即可构建定理库。实验表明,发现的定理具有意义,并能提升大语言模型的证明性能。

0 人收藏 0 人点赞
#mathematical-reasoning

Riazi-8B:一个用于数学推理的乌尔都语大语言模型

arXiv cs.CL · 2026-06-25 缓存

Riazi-8B是一个针对数学推理微调的乌尔都语大语言模型,通过在乌尔都语思维链数据上持续预训练和监督微调,在MGSM-Urdu上实现了性能提升。

0 人收藏 0 人点赞
#mathematical-reasoning

超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization

arXiv cs.AI · 2026-06-24 缓存

介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。

0 人收藏 0 人点赞
#mathematical-reasoning

AI逻辑的蛮力方法确实遇到了瓶颈

Reddit r/ArtificialInteligence · 2026-06-22

文章认为自回归语言模型无法真正理解形式数学,需要验证方法,并引用了诸如Aleph等依赖严格数学证明的系统。

0 人收藏 0 人点赞
#mathematical-reasoning

ReNIO:为LLM在线策略蒸馏重新加权负轨迹重要性

Hugging Face Daily Papers · 2026-06-22 缓存

ReNIO通过基于token级概率比重新加权负轨迹来增强LLM的在线策略蒸馏,提升了数学和代码生成任务中的推理性能。

0 人收藏 0 人点赞
#mathematical-reasoning

VeriEvol: 通过可验证的Evol-Instruct扩展多模态数学推理

Hugging Face Daily Papers · 2026-06-22 缓存

VeriEvol是一个新颖的框架,用于在视觉数学推理中扩展强化学习,通过一个双轴方法来确保可靠的奖励标签,该双轴方法将提示难度与答案可靠性分离,使用进化算子和假设检验验证。它在五个基准的视觉数学测试集上取得了显著的准确率提升。

0 人收藏 0 人点赞
#mathematical-reasoning

多语言中数学推理的LLM参数:共享还是独立?

arXiv cs.CL · 2026-06-18 缓存

本文提出了一种跨语言的LLM数学推理机制分析,发现数学相关参数在不同语言之间存在部分重叠,主要集中于中间层。英语拥有最大规模的数学相关参数集,而低资源语言则拥有较小的参数集。

0 人收藏 0 人点赞
#mathematical-reasoning

MathVis-Fine:通过渐进式依赖引导训练对齐视觉监督与必要性,实现多模态数学推理

arXiv cs.AI · 2026-06-17 缓存

本文介绍了MathVis-Fine,一个用于多模态数学推理中细粒度视觉依赖建模的框架,同时包含一个新数据集和一个两阶段渐进式训练范式,该范式根据每个样本固有的视觉依赖水平平衡答案正确性奖励和视觉接地奖励。

0 人收藏 0 人点赞
#mathematical-reasoning

打破自回归诅咒:动态认知熵编排的可擦除强化学习用于LLMs

arXiv cs.AI · 2026-06-17 缓存

本文提出E³RL,一种使用动态认知熵阈值的强化学习方法,使LLMs能够在生成过程中切除局部逻辑缺陷,克服长程推理中的自回归诅咒,并在AIME等数学推理基准上取得最先进的结果。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈