olympiad-reasoning

标签

Cards List
#olympiad-reasoning

@stingning:我们正在发布一个30B-A3B推理模型,该模型在物理和数学奥林匹克评估中达到了金牌水平……

X AI KOLs Timeline ↗ · 2026-05-15 缓存

研究人员发布了SU-01,这是一个30B-A3B推理模型,在物理和数学奥林匹克问题上达到了金牌水平,使用了一种统一的证明搜索缩放方法。

0 人收藏 0 人点赞
#olympiad-reasoning

通过简单统一的缩放实现金牌级奥赛推理

arXiv cs.AI ↗ · 2026-05-14 缓存

本文提出了一种简单统一的配方,结合监督微调、两阶段强化学习和测试时缩放,训练出一个推理模型(SU-01),在国际数学和物理奥林匹克竞赛中达到金牌级表现。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈