Frontis-MA1:训练面向机器学习工程中递归自我改进的AI4AI模型

Hugging Face Daily Papers 论文

摘要

本文介绍了OpenMLE,一个用于研究机器学习工程中递归自我改进的开放全栈系统,并提出了Frontis-MA1,一个经过后训练作为元进化智能体的35B模型。它在MLE-BenchLite上相比其基础模型有显著提升,并能迁移到留出基准上,同时发布了权重和代码。

递归自我改进(RSI)要求AI系统改进构建AI的过程(即AI4AI);机器学习工程(MLE)为研究这一能力提供了具体且可执行的测试平台。我们介绍了OpenMLE,一个用于MLE中RSI研究的开放全栈系统,涵盖带执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)以及长视界搜索(OpenMLE-Evo)。在此栈上,我们将Frontis-MA1(35B)后训练为面向MLE的元进化智能体,使后训练和推理围绕四个原子程序进化算子(Draft、Improve、Debug、Crossover)对齐:这些算子通过基于执行结果的SFT和RL进行训练,所用数据已针对所有评估基准去重,随后组合到长视界搜索中,从而在单一循环中耦合学习与进化。在MLE-Bench Lite上,单块RTX 4090(显存上限12 GB)每任务12小时的预算下,Frontis-MA1(35B)使用OpenMLE-Evo将其基础模型的奖牌平均分(Medal Average)从39.39%提升到60.61%,并使用OpenMLE-Evo-Max(基准无关的经验先验与异步搜索)达到71.21%,超过了GPT-5.5 + Codex,接近GPT-5.6 Sol和2.8T Kimi K3。在留出的NatureBench Lite上,两个组件均可迁移:框架固定时,换成训练后的模型将Match-SOTA从50%提升到70%;模型固定时,换成OpenMLE-Evo将其从20%提升到50%。我们发布了模型权重和完整的OpenMLE栈,以支持面向RSI的可执行AI4AI的可复现研究。代码:https://github.com/FrontisAI/OpenRSI
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - Frontis-MA1:训练一个面向机器学习工程递归自我改进的AI4AI模型

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

递归自我改进(RSI)要求AI系统能够改进构建AI的过程(即AI4AI);机器学习工程(MLE)为研究这一能力提供了一个具体且可执行的测试平台。我们推出了OpenMLE,一个面向MLE中RSI研究的开放全栈系统,涵盖带执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)和长时程搜索(OpenMLE-Evo)。在这套系统之上,我们将Frontis-MA1(35B)后训练为面向MLE的元进化智能体,将后训练和推理过程围绕四个原子程序进化算子(Draft、Improve、Debug、Crossover)进行对齐:这些算子通过基于执行结果的SFT和RL进行训练,训练数据均与所有评估基准去重,然后组合成长时程搜索,在单一循环中耦合学习与进化。在MLE-Bench Lite上,每任务在单张RTX 4090(显存上限12GB)的12小时预算下,Frontis-MA1(35B)使用OpenMLE-Evo将Medal Average从其基础模型的39.39%提升至60.61%,使用OpenMLE-Evo-Max(与基准无关的经验先验和异步搜索)达到71.21%,超过了GPT-5.5+Codex,接近GPT-5.6 Sol和2.8T Kimi K3。在留出的NatureBench Lite上,两者都能迁移:固定框架时,换用训练后的模型将Match-SOTA从50%提升到70%;固定模型时,换用OpenMLE-Evo将其从20%提升到50%。我们发布了模型权重和完整的OpenMLE栈,以支持面向RSI的可执行AI4AI的可复现研究。代码:https://github.com/FrontisAI/OpenRSI

查看arXiv页面 (https://arxiv.org/abs/2607.28568) 查看PDF (https://arxiv.org/pdf/2607.28568) 项目页面 (https://frontisai.github.io/OpenRSI/) GitHub1 (https://github.com/FrontisAI/OpenRSI) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28568)

引用该论文的模型4

  • FrontisAI/Frontis-MA1-30B 文本生成• 31B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-30B)

  • FrontisAI/Frontis-MA1-30B-GGUF 文本生成• 31B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-30B-GGUF)

  • FrontisAI/Frontis-MA1-35B 图像-文本到文本• 36B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-35B)

  • FrontisAI/Frontis-MA1-35B-GGUF 图像-文本到文本• 35B• 更新于约3小时前 • 1 (https://huggingface.co/FrontisAI/Frontis-MA1-35B-GGUF)

引用该论文的数据集2

  • FrontisAI/OpenMLE-Tasks 更新于约3小时前 • 1 (https://huggingface.co/datasets/FrontisAI/OpenMLE-Tasks)

  • FrontisAI/OpenMLE-SFT-Traces 查看器• 更新于约3小时前 • 26.3k • 1 (https://huggingface.co/datasets/FrontisAI/OpenMLE-SFT-Traces)

引用该论文的Spaces0

没有链接此论文的Space

在Space的README.md中引用arxiv.org/abs/2607.28568,即可从本页链接到该论文。

包含该论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章

@qinzytech: https://x.com/qinzytech/status/2066585405479371092

X AI KOLs Timeline

对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。

通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化

Hugging Face Daily Papers

# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,