@yuetai12575: 兴奋地看到随着模型扩展,收益进一步持续!
摘要
文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。
查看缓存全文
缓存时间: 2026/09/24 00:19
看到模型扩展带来的收益得以进一步延续,令人振奋!
认真对待超级人工智能(ASI),就要接受一个由弱到强的前提:人类智能能够构建一个最终产生超越自身智能的过程。递归自我改进(RSI)正是实现ASI愿景的最后一块拼图,它作为洞察扩展的关键:人类的洞察受限于带宽,而智能体则能扩展想法的生成能力,探索方法空间中远比人类所能触及的更广阔区域。
作为项目的早期发起者,我们深知尽管如今每个人都对RSI感到兴奋,但参与的高门槛却将大多数人挡在了门外。我们相信,一个模型的RSI能力本质上源于研究人员、独立实验室和领域团队的共同努力,并认为这些收益最终应该回馈给所有构建模型的人。
正因如此,我们将自己的项目命名为OpenRSI-Index。我们的目标是借助共享平台和工具保持RSI的开放性,让更多人参与其中并受益。我们可以共同塑造RSI的发展方向,制定RSI的标准,并通过我们自身相关的实际研究工作来挑战前沿模型。
为此,我们构建了RSI-Anything——一个人机协作流程。通过大约一小时的对话,该流程能帮助将一个真实的研究问题转化为可运行的自动研究环境。我们希望研究人员和智能体能够共同解决这些问题,与社区分享新的洞察、方法和成果。
以下是我们已经呈现的内容: • 来自真实研究项目的任务:Marin-Scaling-Ladder、GPIC-Leaderboard、Open-Jev-Training、Molmo2、Isaac Lab… • 超长时间跨度:超过60小时的智能体轨迹;为预览版本构建了超过100,000个H100小时的计算资源 • 全面开放,包括完整轨迹:任务、工具链、验证器、完整的智能体运行轨迹
我们相信研究永无止境。当利益蛋糕太小而无法分享时,游戏才会变成零和博弈。然而,研究无疑是拥有最高天花板的领域。真正改变的是思维方式:它解放了研究人员,去发现并构想世界上那些更疯狂、更有价值、更令人兴奋的问题。
相似文章
奖励模型过度优化的标度律
OpenAI 研究人员通过实验研究了奖励模型过度优化对性能的影响,建立了标度律来说明代理奖励优化与真实性能之间的关系如何随优化方法变化,并与模型规模成可预测的关系。
2023-2031年模型规模扩展(阅读时间21分钟)
一篇关于AI模型规模扩展趋势的分析,发布于LessWrong,时间跨度为2023年至2031年。
在复杂监管领域扩展领域专业知识
Blue J 展示了如何通过将 GPT-4.1 与基于精选税务文档的检索增强生成相结合,在复杂监管领域扩展 AI 专业知识,实现低于 0.14% 的错误率和 70% 的周用户参与度,并通过严格的反馈循环和领域特定优化来优化性能。
来自Adam Majmudar(OpenAI研究员)的有趣帖子——全文见正文
Adam Majmudar对AI能力快速发展的分析,重点介绍了新的扩展规律如何推动超越外部预期的飞跃。
模块化AI系统中的参与扩展
本文介绍了“参与扩展”这一新范式,通过多样化利益相关者的贡献构建模块化AI系统。其中,小型模型协作在多种任务上比单体LLM性能高出最多15.4%,展现出涌现能力并改善多样性收益。