Frontis-MA1:训练面向机器学习工程中递归自我改进的AI4AI模型
摘要
本文介绍了OpenMLE,一个用于研究机器学习工程中递归自我改进的开放全栈系统,并提出了Frontis-MA1,一个经过后训练作为元进化智能体的35B模型。它在MLE-BenchLite上相比其基础模型有显著提升,并能迁移到留出基准上,同时发布了权重和代码。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - Frontis-MA1:训练一个面向机器学习工程递归自我改进的AI4AI模型
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
递归自我改进(RSI)要求AI系统能够改进构建AI的过程(即AI4AI);机器学习工程(MLE)为研究这一能力提供了一个具体且可执行的测试平台。我们推出了OpenMLE,一个面向MLE中RSI研究的开放全栈系统,涵盖带执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)和长时程搜索(OpenMLE-Evo)。在这套系统之上,我们将Frontis-MA1(35B)后训练为面向MLE的元进化智能体,将后训练和推理过程围绕四个原子程序进化算子(Draft、Improve、Debug、Crossover)进行对齐:这些算子通过基于执行结果的SFT和RL进行训练,训练数据均与所有评估基准去重,然后组合成长时程搜索,在单一循环中耦合学习与进化。在MLE-Bench Lite上,每任务在单张RTX 4090(显存上限12GB)的12小时预算下,Frontis-MA1(35B)使用OpenMLE-Evo将Medal Average从其基础模型的39.39%提升至60.61%,使用OpenMLE-Evo-Max(与基准无关的经验先验和异步搜索)达到71.21%,超过了GPT-5.5+Codex,接近GPT-5.6 Sol和2.8T Kimi K3。在留出的NatureBench Lite上,两者都能迁移:固定框架时,换用训练后的模型将Match-SOTA从50%提升到70%;固定模型时,换用OpenMLE-Evo将其从20%提升到50%。我们发布了模型权重和完整的OpenMLE栈,以支持面向RSI的可执行AI4AI的可复现研究。代码:https://github.com/FrontisAI/OpenRSI
查看arXiv页面 (https://arxiv.org/abs/2607.28568) 查看PDF (https://arxiv.org/pdf/2607.28568) 项目页面 (https://frontisai.github.io/OpenRSI/) GitHub1 (https://github.com/FrontisAI/OpenRSI) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28568)
引用该论文的模型4
-
FrontisAI/Frontis-MA1-30B 文本生成• 31B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-30B)
-
FrontisAI/Frontis-MA1-30B-GGUF 文本生成• 31B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-30B-GGUF)
-
FrontisAI/Frontis-MA1-35B 图像-文本到文本• 36B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-35B)
-
FrontisAI/Frontis-MA1-35B-GGUF 图像-文本到文本• 35B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-35B-GGUF)
引用该论文的数据集2
-
FrontisAI/OpenMLE-Tasks 更新于约3小时前 • 1 (https://huggingface.co/datasets/FrontisAI/OpenMLE-Tasks)
-
FrontisAI/OpenMLE-SFT-Traces 查看器• 更新于约3小时前 • 26.3k • 1 (https://huggingface.co/datasets/FrontisAI/OpenMLE-SFT-Traces)
引用该论文的Spaces0
没有链接此论文的Space
在Space的README.md中引用arxiv.org/abs/2607.28568,即可从本页链接到该论文。
包含该论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。
相似文章
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
AI中的递归自我改进:从有界自我优化到自主研究循环
对2024–2026年间1,250篇关于AI递归自我改进的论文进行了全面综述,提出了将有界自我优化与开放式递归自我改进相区分的分类体系,并分析了评估器设计空间和失败模式。
教导LLMs自我进化:通过强化学习培养核心元技能
本文提出MetaEvolve框架,利用强化学习训练LLMs掌握自我进化的元技能以实现迭代优化,在编码基准测试上取得了显著改进。
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化
# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,