标签
本文介绍了一个用于评估几何中图表推理的开源基准,揭示了尽管基础模型如GPT和Claude在解决问题上表现出色,但它们难以生成忠实的图表。
该线程探讨了数学/编程奥赛背景如何批量培养科技创始人,指出竞赛范式内化的系统化解题能力、信念和同侪效应是核心引擎,量化金融作为中转站,但也提醒创业需要超越解题的技能。
一篇论文介绍了一种统一配方(SU-01),结合了反向困惑度课程、两阶段强化学习和测试时缩放,使用30B-A3B主干在IMO和IPhO问题上实现了金牌级别的表现。
本文对多模态物理评估流程进行了审计,揭示了诸如训练-评估污染、翻译漂移和多项选择题(MCQ)饱和等问题。它发布了新数据集(PhysCorp-A、PhysR1Corp、PhysOlym-A)和一个训练配方(Physics-R1),显著提高了在保留的奥赛问题上的性能。
一篇介绍SU-01的论文,该模型为30B-A3B推理模型,通过反向困惑度课程、两阶段强化学习和测试时缩放,在IMO和IPhO问题上达到金牌级表现。
麻省理工学院(MIT)研究人员与沙特阿卜杜拉国王科技大学(KAUST)及 HUMAIN 公司合作,发布了 MathNet。这是目前最大的开源奥数级数学问题数据集,包含来自 47 个国家的超过 30,000 道由专家编写的问题。
# 解决(部分)形式化数学奥林匹克问题 来源:[https://openai.com/index/formal-math/](https://openai.com/index/formal-math/) 我们在 [miniF2F](https://arxiv.org/abs/2109.00110) 基准测试上实现了新的最先进成果(41.2% vs 29.3%),这是一个具有挑战性的高中奥林匹克问题集合。我们的方法称为*语句课程学习*,包括手动收集一组难度级别不同的陈述(不含证明)