@yuetai12575: 兴奋地看到随着模型扩展,收益进一步持续!

X AI KOLs Timeline 论文

摘要

文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。

兴奋地看到随着模型扩展,收益进一步持续!
查看原文
查看缓存全文

缓存时间: 2026/09/24 00:19

看到模型扩展带来的收益得以进一步延续,令人振奋!

认真对待超级人工智能(ASI),就要接受一个由弱到强的前提:人类智能能够构建一个最终产生超越自身智能的过程。递归自我改进(RSI)正是实现ASI愿景的最后一块拼图,它作为洞察扩展的关键:人类的洞察受限于带宽,而智能体则能扩展想法的生成能力,探索方法空间中远比人类所能触及的更广阔区域。

作为项目的早期发起者,我们深知尽管如今每个人都对RSI感到兴奋,但参与的高门槛却将大多数人挡在了门外。我们相信,一个模型的RSI能力本质上源于研究人员、独立实验室和领域团队的共同努力,并认为这些收益最终应该回馈给所有构建模型的人。

正因如此,我们将自己的项目命名为OpenRSI-Index。我们的目标是借助共享平台和工具保持RSI的开放性,让更多人参与其中并受益。我们可以共同塑造RSI的发展方向,制定RSI的标准,并通过我们自身相关的实际研究工作来挑战前沿模型。

为此,我们构建了RSI-Anything——一个人机协作流程。通过大约一小时的对话,该流程能帮助将一个真实的研究问题转化为可运行的自动研究环境。我们希望研究人员和智能体能够共同解决这些问题,与社区分享新的洞察、方法和成果。

以下是我们已经呈现的内容: • 来自真实研究项目的任务:Marin-Scaling-Ladder、GPIC-Leaderboard、Open-Jev-Training、Molmo2、Isaac Lab… • 超长时间跨度:超过60小时的智能体轨迹;为预览版本构建了超过100,000个H100小时的计算资源 • 全面开放,包括完整轨迹:任务、工具链、验证器、完整的智能体运行轨迹

我们相信研究永无止境。当利益蛋糕太小而无法分享时,游戏才会变成零和博弈。然而,研究无疑是拥有最高天花板的领域。真正改变的是思维方式:它解放了研究人员,去发现并构想世界上那些更疯狂、更有价值、更令人兴奋的问题。

相似文章

奖励模型过度优化的标度律

OpenAI Blog

OpenAI 研究人员通过实验研究了奖励模型过度优化对性能的影响,建立了标度律来说明代理奖励优化与真实性能之间的关系如何随优化方法变化,并与模型规模成可预测的关系。

在复杂监管领域扩展领域专业知识

OpenAI Blog

Blue J 展示了如何通过将 GPT-4.1 与基于精选税务文档的检索增强生成相结合,在复杂监管领域扩展 AI 专业知识,实现低于 0.14% 的错误率和 70% 的周用户参与度,并通过严格的反馈循环和领域特定优化来优化性能。

模块化AI系统中的参与扩展

arXiv cs.AI

本文介绍了“参与扩展”这一新范式,通过多样化利益相关者的贡献构建模块化AI系统。其中,小型模型协作在多种任务上比单体LLM性能高出最多15.4%,展现出涌现能力并改善多样性收益。